Podczas szczytu OCP Global Summit 2025 firma Intel podkreśliła znaczenie wnioskowania AI, prezentując dwa kluczowe osiągnięcia: nowy procesor graficzny GPU dla centrów danych o nazwie „Crescent Island” oraz projekt referencyjny Gaudi 3 w skali rack. Oba te rozwiązania wpisują się w rosnącą transformację od trenowania modeli do powszechnego wnioskowania w czasie rzeczywistym, gdzie kluczowe są obecnie takie czynniki jak opóźnienie, przepustowość pamięci, wydajność i prostota operacyjna.
Od szkolenia statycznego do wszechobecnego wnioskowania w czasie rzeczywistym
Dyrektor ds. technologii firmy Intel, Sachin Katti, podsumował tę transformację, zauważając, że wraz z upowszechnianiem się sztucznej inteligencji opartej na agentach, wnioskowanie staje się ciągłe, bogate w kontekst i coraz bardziej wymagające systemowo. Aby zarządzać rosnącą liczbą tokenów, złożonymi kombinacjami modalności i rygorystycznymi wymaganiami SLA, niezbędna staje się heterogeniczna infrastruktura łącząca optymalną architekturę z otwartym, zorientowanym na deweloperów stosem oprogramowania. W tym środowisku procesory graficzne Intel Xe dla centrów danych oferują pojemność i niezawodność potrzebną w miarę wzrostu długości sekwencji i częstotliwości tokenów, podczas gdy Gaudi 3 obsługuje otwarty, skalowalny ekosystem wnioskowania z przewidywalnym całkowitym kosztem posiadania (TCO).
Kluczowym wnioskiem nie są po prostu „szybsze układy”. Sukces wnioskowania zależy od integracji systemów: pamięci uwzględniającej topologię, elastycznych połączeń, zasilania i chłodzenia dopasowanych do profili wykorzystania oraz orkiestracji, która traktuje modele, tokeny i strumienie jako obywateli pierwszej klasy. Przedsiębiorstwa nie chcą być „uwięzione” dokładnie w momencie, gdy muszą iterować między modelami, frameworkami i stosami usług.
Obejmujący komputer, krawędź i centrum danych
Intel argumentuje, że zajmuje wyjątkową pozycję, umożliwiającą oferowanie kompleksowych rozwiązań, dzięki komputerom z AI, przemysłowym rozwiązaniom brzegowym i szafom serwerowym dla centrów danych opartym na procesorach Xeon 6, akceleratorach Gaudi 3 i procesorach graficznych Intel. Wśród wspólnych tematów znajdują się:
- Elastyczność PCIe w zakresie różnorodności pozwala na ponowne wykorzystanie istniejących zasobów, gdy jest to możliwe, i umożliwia skalowanie do szaf zorientowanych na strukturę, jeśli zajdzie taka potrzeba.
- Konstrukcje o konstrukcji rackowej zapewniają przewidywalną wydajność na wat i obejmują opcje chłodzenia cieczą, gdy wymagają tego wysokie wymagania dotyczące gęstości i temperatury.
- Kompleksowa, zintegrowana platforma programowa, której celem jest zapewnienie płynnego rozwoju w różnych typach układów scalonych i na różnych poziomach wdrożenia.
Partnerstwo z OCP potwierdza preferencje firmy dotyczące otwartych, referencyjnych projektów, które są łatwiejsze do pozyskania, walidacji i skalowania w operacjach.
Crescent Island: procesor graficzny do centrów danych dostosowany do ekonomii wnioskowania
Crescent Island to nowy procesor graficzny Intela do centrów danych, zaprojektowany z myślą o chłodzonych powietrzem serwerach korporacyjnych, które wymagają wysokiej przepustowości tokenów bez konieczności stosowania zaawansowanych rozwiązań zasilania i chłodzenia. Jego priorytetem jest praktyczność: priorytetem jest efektywność kosztowa i energooszczędność, a jednocześnie pojemność pamięci i przepustowość niezbędne do nowoczesnych zadań wnioskowania.
Najważniejsze to:
- Mikroarchitektura Xe3P skoncentrowana na wydajności na wat. Jest to zgodne z wnioskowaniem w stanie ustalonym, gdzie wykorzystanie jest stałe, a wrażliwość na koszty wysoka.
- 160 GB pamięci LPDDR5X na karcie. W przypadku obsługi LLM/RAG, podsumowania długiego kontekstu i potoków multimodalnych, pojemność i przepustowość pamięci często powodują większe obciążenie QPS i opóźnienia ogonowe niż surowe TOPS.
- Obsługa szerokiej gamy typów danych, zaprojektowana z myślą o dostawcach „tokenów jako usługi”. Elastyczność w zakresie mieszanej precyzji/kwantyzacji ma kluczowe znaczenie dla ograniczenia przepustowości przy jednoczesnym zachowaniu dokładności punktów końcowych w środowisku produkcyjnym.
- Gotowość oprogramowania dzięki otwartemu, zunifikowanemu stosowi Intel. Wczesna optymalizacja procesorów graficznych Arc Pro serii B ma na celu usprawnienie pracy programistów i zminimalizowanie problemów z przenoszeniem.
- Harmonogram: Próbkowanie klientów Crescent Island jest spodziewane w drugiej połowie 2026 r. Dla nabywców planujących cykle odświeżania w latach 2026–2027 daje to praktyczne okno na przeprowadzenie pilotażu stosu oprogramowania i wzorców obsługi modeli już teraz.
Crescent Island koncentruje się na ekonomii wnioskowania w dużej skali. Jest chłodzony powietrzem, zorientowany na pojemność i skoncentrowany na stosunku wydajności do mocy obliczeniowej (P/W). Załóżmy, że Twoje obciążenia są zdominowane przez obsługę intensywnie wykorzystującą tokeny i z rygorystycznymi limitami opóźnień (SLO). W takim przypadku wbudowane 160 GB i wydajne typy danych powinny przełożyć się na więcej jednoczesnych sesji na wat i mniej niespodzianek związanych z klastrami w miarę wzrostu długości sekwencji.
Gaudi 3: Referencyjna skala stojaka dla dużych modeli i wnioskowania w czasie rzeczywistym
Gaudi 3 rozszerza możliwości wdrożeń PCIe na kompletne konfiguracje w skali rack, oferując ścieżkę skalowania bez konieczności jednoczesnego wdrażania architektury. Nowy projekt referencyjny w skali rack jest skierowany do przedsiębiorstw standaryzujących wnioskowanie w oparciu o duże modele i systemy czasu rzeczywistego o krytycznym opóźnieniu.
Kluczowe elementy:
- Sekwencja PCIe-do-stelażu rozpoczyna się od kart PCIe w obecnych serwerach i obejmuje również stelaże, zgodnie z rozmiarami modeli, współbieżnością i profilami SLA. To podejście, będące powszechną strategią przedsiębiorstw, pomaga minimalizować ryzyko projektu.
- Obsługuje do 64 akceleratorów na szafę z 8.2 TB pamięci o wysokiej przepustowości. Kluczowa funkcja, domena pamięci (HBD), umożliwia obsługę większej liczby parametrów i dłuższych kontekstów pamięci, co przekłada się na mniej spadków wydajności i bardziej spójny poziom opóźnień.
- Opcje chłodzenia cieczą są niezbędne w przypadku gęstości akceleratora, w których samo chłodzenie powietrzem ogranicza trwałe wnioskowanie.
- Orkiestracja obejmuje otwarty stos oprogramowania, taki jak Kubernetes, serwery standardowego modelu i popularne struktury, co upraszcza integrację z istniejącymi architekturami MLOps i service-mesh.
W procesie wnioskowania produkcyjnego czynniki takie jak topologia pamięci i spójne zarządzanie temperaturą przewyższają szczytową teoretyczną wydajność. Szafa Gaudi 3, wyposażona w 8.2 TB pamięci HBM w 64 akceleratorach, spełnia praktyczne potrzeby, takie jak ładowanie wielu dużych wariantów, zarządzanie długimi monitami i obsługa serii bez powodowania zakłóceń. Chłodzenie cieczą nie jest jedynie opcjonalne przy takich gęstościach; jest niezbędne do utrzymania liczby zapytań na sekundę (QPS) i opóźnień w warunkach stresu cieplnego.
Oś czasu
- Oprogramowanie:Ujednolicony, otwarty stos oprogramowania firmy Intel jest przygotowywany na procesorach graficznych Arc Pro B-Series, aby dać deweloperom wczesny moment na optymalizację i integrację CI/CD.
- Wyspa Crescent: Badanie klientów planowane na drugą połowę 2026 r. Planowane są oceny gotowości oprogramowania, profili obsługi opartych na pamięci oraz ograniczeń centrów danych chłodzonych powietrzem.
- Gaudi 3 stojakiProjekty referencyjne określają do 64 akceleratorów na szafę, 8.2 TB pamięci HBM i chłodzenie cieczą, co pozwala na wcześniejsze dostosowanie infrastruktury oraz zakresu zasilania/chłodzenia do zespołów ds. centrum dystrybucji/centrali przetwarzania danych.




Amazon