StorageReview.com

NVIDIA Groq 3 LPX wchodzi do pełnej produkcji: 3,400 tokenów na sekundę przy 100 tys. kontekstów, 256 LP30 na szafę

AI  ◇  Enterprise

Firma NVIDIA ogłosiła premierę produkcyjną NVIDIA Groq 3 LPX , dedykowanego interaktywnego akceleratora wnioskowania, stworzonego jako uzupełnienie platformy Vera Rubin NVL72. Wraz z przejściem obciążeń AI przedsiębiorstw od wstępnego trenowania modelu surowego do wnioskowania w czasie rzeczywistym i autonomicznej koordynacji agentów, zmieniają się wymagania infrastrukturalne. Przepływy pracy agentów wymagają iteracyjnego, wieloetapowego wykonywania, gdzie opóźnienie podczas generowania tokenów może się kumulować w przypadku zautomatyzowanych ścieżek wnioskowania, zapytań do narzędzi zewnętrznych i komunikacji między agentami.

Schemat zasobnika obliczeniowego NVIDIA Groq 3 LPX: zasobnik chłodzony cieczą 1U z ośmioma jednostkami Groq 3 LPU, procesorem hosta, kartą DPU BlueField-4 lub kartą sieciową ConnectX-9 i kartą Ethernet 400 Gb/s

Architektura Groq 3 LPX doskonale sprawdza się w tej fazie dekodowania. Każda chłodzona cieczą tacka obliczeniowa 2U zawiera szesnaście jednostek LPU Groq 3 wraz z procesorem hosta, logiką rozbudowy struktury i pamięcią DRAM oraz kartą DPU BlueField-4 lub ConnectX-9 z 32 łączami optycznymi typu chip-to-chip LPU i Ethernetem 400 Gb/s z przodu. W heterogenicznym wdrożeniu, obok systemów Vera Rubin NVL72, procesory graficzne NVIDIA Rubin obsługują pobieranie kontekstu i obliczenia wstępnego wypełniania ogromnych zestawów danych wejściowych, podczas gdy jednostki Groq 3 LPX przetwarzają wrażliwe na opóźnienia generowanie tokenów wyjściowych.

Architektura i wydajność testów porównawczych

W standardowych ocenach wydajności sztucznej inteligencji (Artificial Analysis) z wykorzystaniem modelu Gemma 4 31B o otwartym kodzie źródłowym i aktywnym oknie kontekstowym o pojemności 100 000 tokenów, platforma Groq 3 LPX osiągnęła wydajność 3,400 tokenów na sekundę. NVIDIA zauważa, że ​​ten poziom przepustowości jest czterokrotnie szybszy niż najbliższa alternatywna platforma przy identycznych parametrach długiego kontekstu, a Artificial Analysis rejestruje go jako najszybszy wynik zmierzony dla tego modelu. Warto uważnie przeczytać to porównanie: dane firmy NVIDIA pochodzą z prywatnego punktu końcowego przedpremierowego, zmierzonego 21 sierpnia, podczas gdy konkurencyjne wartości dotyczą działających, bezserwerowych punktów końcowych w środowisku produkcyjnym. Utrzymanie ekstremalnej prędkości generowania w oknach o pojemności 100 000 tokenów jest kluczowe dla architektur agentów korporacyjnych, które stale analizują rozległe repozytoria kodu, złożone schematy API i bogatą dokumentację techniczną.

Render pakietu NVIDIA Groq 3 LPU przedstawiający układ scalony używany w akceleratorze wnioskowania Groq 3 LPX Wykres analizy sztucznej pokazujący NVIDIA Groq 3 LPX z prędkością 3,401 tokenów wyjściowych na sekundę na Gemma 4 31B przy 100K kontekstu, około 4 razy więcej niż najbliższa platforma

Z punktu widzenia fizycznej architektury systemu wdrożenie Groq 3 LPX w skali szafy obejmuje maksymalnie 256 akceleratorów LP30 połączonych za pomocą szybkich, bezpośrednich połączeń między układami scalonymi.

Wdrożenia w chmurze i ekosystem systemów

Trwa wczesna komercyjna adaptacja przez wyspecjalizowanych dostawców usług chmurowych. Nebius został mianowany pierwszym partnerem w chmurze AI, który wdrożył Groq 3 LPX, planując wprowadzenie tego sprzętu do produkcyjnej usługi wnioskowania Nebius Token Factory. Architektura ta została zaprojektowana tak, aby umożliwić programistom dostęp do akceleracji wnioskowania w czasie rzeczywistym za pośrednictwem istniejących interfejsów API bez konieczności migracji baz kodu do nowych abstrakcji frameworka. Dostawca wnioskowania, Groq, spodziewa się być jednym z pierwszych użytkowników tej platformy.

Wykres firmy NVIDIA, który wskazuje na 30-krotną przepustowość tokenów na megawat dla Vera Rubin NVL72 w porównaniu z GB300 NVL72 przy obciążeniu kodowania agentowego 140K kontekstów Wykres firmy NVIDIA przedstawiający liczbę tokenów na sekundę na megawat w zestawieniu z interaktywnością użytkownika, pokazujący rozszerzenie układu Groq 3 LPX Vera Rubin NVL72 do obszaru o najniższym opóźnieniu

NVIDIA łączy premierę z zaktualizowaną matematyką platformy dla szafy rack, do której jest podłączana, zapewniając nawet 30-krotnie większą przepustowość tokenów na megawat dla Vera Rubin NVL72 w porównaniu z GB300 NVL72 przy obciążeniu kodowania agentowego 140 000 tokenów, a przewaga ta rośnie wraz ze wzrostem docelowych interaktywności dla użytkownika. Implementacja sprzętowa jest zgodna z infrastrukturą fabryczną pełnego stosu sztucznej inteligencji Rubin firmy NVIDIA, która obejmuje siedem oddzielnych układów scalonych w pięciu specjalnie zaprojektowanych konfiguracjach szaf rack.

Render rodziny szaf NVIDIA Vera Rubin przedstawiający pięć specjalnie zaprojektowanych konfiguracji szaf w platformie fabrycznej AI

Elementy systemu działające wraz z klastrami obliczeniowymi Rubin i LPX obejmują szafy procesorów NVIDIA Vera, macierze pamięci masowej Vera BlueField-4 STX i struktury sieciowe NVIDIA Spectrum-6 SPX.

Co mówią NVIDIA i Nebius

„Wnioskowanie jest motorem napędowym rozwoju sztucznej inteligencji. NVIDIA Grace Blackwell i NVL72 zrewolucjonizowały wnioskowanie w modelach wielojęzykowych, zapewniając bezprecedensowy skok w wydajności i efektywności” – powiedział Jensen Huang, założyciel i dyrektor generalny firmy NVIDIA. „Vera Rubin rozszerza tę wizję, oferując zoptymalizowane pod kątem obciążenia konfiguracje fabryczne sztucznej inteligencji, zaprojektowane z myślą o erze sztucznej inteligencji opartej na agentach, przesuwając granicę wydajności dzięki LPX do ultraszybkiego generowania tokenów”.

Nebius określił wartość w kontekście faktycznego opóźnienia dla użytkowników. „Generowanie to faza wnioskowania, która określa, jak responsywny jest system sztucznej inteligencji, i właśnie do tego została stworzona platforma NVIDIA Groq 3 LPX” – powiedziała Danila Shtan, dyrektor ds. technologii w Nebius. „Jako pierwsza chmura AI, która wprowadza ją do produkcji za pośrednictwem Nebius Token Factory, dbamy o to, aby każdy krok w pętli agenta był natychmiastowy, za pośrednictwem tego samego interfejsu API, z którego korzystają już programiści, bez konieczności migracji do nowego stosu”.

Infrastruktura wielopłaszczyznowa i skalowalna Spectrum-X

Aby sprostać ogromnemu zapotrzebowaniu sieciowemu tych fabryk wnioskowania, NVIDIA zaprezentowała architekturę Spectrum-X Multiplane Ethernet. Tradycyjna rozbudowa klastra poza współczesne ograniczenia gęstości często wymaga dodania trzeciej warstwy przełączającej, co wiąże się z opóźnieniami, kosztami okablowania optycznego i nadmiernym zużyciem energii. Spectrum-X Multiplane omija ten problem, dzieląc interfejsy sieciowe hosta na wiele niezależnych warstw, z których każda obsługuje płaską, dwuwarstwową sieć skalowalną do 512 000 GPU.

Slajd topologii wielopłaszczyznowej NVIDIA Spectrum-X pokazujący skalowalność wielotorowych płaszczyzn SuperNIC do 512 000 procesorów GPU z 11-krotnie szybszym odzyskiwaniem danych

Zarządzanie ruchem i łagodzenie awarii są obsługiwane w układzie scalonym przez układ NVIDIA ConnectX-9 SuperNIC, który obsługuje prędkości sieci do 1,600 Gb/s na GPU w połączeniu z układami ASIC Spectrum-6 Ethernet o przepustowości 102.4 Tb/s. Spectrum-XGS Ethernet rozszerza ten sam kod między obiektami, co według firmy NVIDIA przyspiesza kolektywne połączenia NCCL w wielu lokalizacjach o 1.9 raza. W topologii ośmiopłaszczyznowej sprzętowe przełączanie awaryjne natychmiast przekierowuje ruch wokół uszkodzonych ścieżek, utrzymując około 90 procent łącznej przepustowości sieci. NVIDIA twierdzi, że sprzętowe odzyskiwanie danych jest 11 razy szybsze niż programowe równoważenie obciążenia wielopłaszczyznowego, co, jak twierdzi, przekłada się na 1.6 razy większą wydajność fabryczną sztucznej inteligencji.

Slajd dotyczący sieci NVIDIA Scale-In przedstawiający usługi DOCA, BlueField-4 i Spectrum-X Ethernet zapewniające bezpieczeństwo fabryk AI i przyspieszenie danych

Równocześnie NVIDIA wprowadziła swój filar sieciowy Scale-In, łączący jednostki przetwarzania danych BlueField-4 ze stosem oprogramowania DOCA . Scale-In jest skierowany do infrastruktury północ-południe, odciążając procesory hosta z izolacji wielu najemców, szyfrowania in-silicon z prędkością łącza, telemetrii i ścieżek danych o wysokiej wydajności.

NVLink Fusion do integracji niestandardowych układów krzemowych

NVIDIA wprowadziła również rozwiązanie NVLink Fusion dla operatorów hiperskalowych wymagających architektur hybrydowych. Platforma ta umożliwia bezpośrednią integrację niestandardowych jednostek XPU i procesorów CPU innych firm z szóstej generacji skalowalnych struktur sieciowych NVLink i NVLink-C2C firmy NVIDIA. Wykorzystując modułowe projekty obudów NVIDIA MGX i oprogramowanie do zarządzania, operatorzy centrów danych mogą standaryzować projekty współdzielonych szaf zasilających, chłodzących i sieciowych, jednocześnie dostosowując konkretne proporcje procesorów graficznych, jednostek LPU i niestandardowych układów scalonych w miarę rozwoju obciążeń.

NVIDIA ogłosiła drugą generację procesorów Vera Rubin na konferencji Hot Chips: SpaceXAI wdraża procesory Vera do obsługi zadań agentowych w satelitach Grok i planuje umieścić zoptymalizowany procesor Vera Rubin NVL72 na orbicie satelity Starmind pierwszej generacji.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Harold Fritts

Pracuję w branży technologicznej od czasu, gdy IBM stworzyło Selectric. Moim głównym zajęciem jest jednak pisanie. Postanowiłem więc odejść z działu przedsprzedaży i wrócić do korzeni, zajmując się trochę pisaniem, ale wciąż angażując się w technologię.