NVIDIA i Google Cloud wykorzystały Google Cloud Next w Las Vegas, aby przedstawić nowy etap swojej długoletniej współpracy inżynieryjnej, wprowadzając aktualizacje platformy Google Cloud AI Hypercomputer, aby skalować agentową i fizyczną sztuczną inteligencję w środowiskach produkcyjnych. Firmy kontynuują wspólne projektowanie infrastruktury obejmującej układy scalone, systemy, sieci i oprogramowanie, aby obsługiwać coraz bardziej złożone obciążenia AI, w tym autonomicznych agentów, robotykę i cyfrowe bliźniaki.
Infrastruktura A5X oparta na Vera Rubin jest ukierunkowana na fabryki sztucznej inteligencji na dużą skalę
Google Cloud wprowadziło instancje A5X bare-metal zbudowane na systemach NVIDIA Vera Rubin NVL72 w obudowie rack. Systemy te zostały zaprojektowane z myślą o znacznej poprawie ekonomiki i wydajności wnioskowania, zapewniając nawet 10-krotnie niższy koszt tokena i 10-krotnie wyższą przepustowość tokena na megawat w porównaniu z poprzednią generacją.
Platforma A5X integruje karty NVIDIA ConnectX-9 SuperNIC ze stosem sieciowym Virgo nowej generacji firmy Google. Ta architektura umożliwia skalowanie klastra do 80 000 procesorów GPU Rubin w jednej lokalizacji i do 960 000 procesorów GPU w przypadku wdrożeń obejmujących wiele lokalizacji. Projekt jest przeznaczony do środowisk uczenia i wnioskowania AI o dużej skali, w których wydajność sieci i optymalizacja na poziomie systemu mają kluczowe znaczenie.
Google Cloud podkreśliło, że do obsługi kolejnej fali obciążeń AI niezbędna jest ściśle zintegrowana infrastruktura i zarządzane usługi AI. Połączony stos umożliwia klientom trenowanie, dostrajanie i wdrażanie modeli z naciskiem na wydajność, efektywność i skalowalność operacyjną.
Szerokie portfolio Blackwell umożliwia przyspieszenie o odpowiedniej skali
Google Cloud przedstawił również swoje portfolio instancji opartych na technologii NVIDIA Blackwell, obejmujące szeroki zakres rozmiarów wdrożeń i profili wydajności. Oferta obejmuje maszyny wirtualne A4 oparte na systemach NVIDIA HGX B200, konfiguracje A4X i A4X Max zbudowane na platformach GB200 i GB300 NVL72 oraz dostęp do częściowej karty graficznej (G4) za pośrednictwem instancji G4 z procesorami graficznymi RTX PRO 6000 Blackwell Server Edition.
Ta gama rozwiązań pozwala organizacjom dostosować infrastrukturę do wymagań obciążenia. Konfiguracje obejmują zarówno ułamkowe jednostki GPU do lżejszych zadań wnioskowania, jak i pełne szafy NVL72 z 72 jednostkami GPU połączonymi za pomocą technologii NVLink piątej generacji i przełączników NVLink. W przypadku zaawansowanych konfiguracji wdrożenia można skalować do dziesiątek tysięcy jednostek GPU w celu trenowania dużych modeli i wnioskowania rozproszonego.
Systemy te są przeznaczone do obsługi szeregu obciążeń związanych ze sztuczną inteligencją, w tym modeli mieszanych z udziałem ekspertów (MoE), wnioskowania multimodalnego, przetwarzania danych na dużą skalę oraz obciążeń symulacyjnych dla robotyki i fizycznej sztucznej inteligencji.
Wcześni użytkownicy już korzystają z platformy. Thinking Machines Lab wykorzystuje instancje A4X Max oparte na GB300 NVL72 do skalowania szkolenia dla swojego interfejsu API Tinker, podczas gdy OpenAI uruchamia obciążenia wnioskowania na dużą skalę, w tym ChatGPT, na instancjach opartych na GB200 i GB300 w Google Cloud.
Poufna sztuczna inteligencja rozszerza się na procesory graficzne Blackwell
Google Cloud rozszerza możliwości przetwarzania poufnego na swoją infrastrukturę AI. Modele Gemini działające na procesorach graficznych NVIDIA Blackwell i Blackwell Ultra są już dostępne w wersji zapoznawczej w Google Distributed Cloud, umożliwiając organizacjom wdrażanie modeli bliżej wrażliwych źródeł danych.
NVIDIA Confidential Computing umożliwia tworzenie szyfrowanych środowisk uruchomieniowych, w których monity i dane dostrajające pozostają chronione przed nieautoryzowanym dostępem, w tym ze strony operatorów chmury. Ta funkcja jest również dostępna w środowiskach wielodostępnych za pośrednictwem maszyn wirtualnych Confidential G4 z procesorami graficznymi RTX PRO 6000 Blackwell.
Jest to pierwsza implementacja poufnego przetwarzania dla procesorów graficznych Blackwell w chmurze publicznej, skierowana do regulowanych branż, które wymagają ścisłej ochrony danych, przy jednoczesnym zachowaniu dostępu do wysokowydajnej infrastruktury AI.
Otwarte modele i zarządzane potoki RL dla agentowej sztucznej inteligencji
Platforma obsługuje szeroki ekosystem modeli, w tym modele Gemini i Gemma firmy Google oraz otwarte modele Nemotron firmy NVIDIA. NVIDIA Nemotron 3 Super jest teraz zintegrowany z platformą Gemini Enterprise Agent, umożliwiając programistom tworzenie i wdrażanie przepływów pracy opartych na wnioskowaniu.
Google Cloud wprowadza również klastry szkoleniowe Managed Training Clusters z interfejsem API uczenia wzmacniającego opartym na technologii NVIDIA NeMo. Usługa ta automatyzuje udostępnianie klastrów, koordynację zadań i obsługę błędów, umożliwiając szkolenie RL na dużą skalę. Celem jest zmniejszenie złożoności operacyjnej i umożliwienie zespołom skupienia się na zachowaniu modelu i jego optymalizacji.
CrowdStrike wykorzystuje narzędzia NVIDIA NeMo, w tym Data Designer, Automodel i Megatron Bridge, do generowania danych syntetycznych i dostrajania modeli cyberbezpieczeństwa dla poszczególnych domen. Te przepływy pracy działają w oparciu o infrastrukturę Blackwell, przyspieszając procesy wykrywania i reagowania na zagrożenia.
Rozszerzające się obciążenia przemysłowe i fizyczne AI
Wspólna platforma jest również ukierunkowana na zastosowania sztucznej inteligencji w przemyśle i fizyce. Aplikacje Cadence i Siemens Digital Industries Software są teraz dostępne w Google Cloud z akceleracją NVIDIA, obsługując procesy projektowania, symulacji i produkcji w branżach takich jak półprzewodniki, motoryzacja, lotnictwo i przemysł ciężki.
Biblioteki NVIDIA Omniverse i Isaac Sim są dostępne w Google Cloud Marketplace, umożliwiając tworzenie fizycznie dokładnych cyfrowych bliźniaków i potoków symulacji robotyki. Narzędzia te pozwalają organizacjom symulować i walidować systemy przed wdrożeniem.
Ponadto mikrousługi NVIDIA NIM można wdrożyć w Vertex AI i Google Kubernetes Engine, aby obsługiwać obciążenia związane z wizją AI i robotyką. Usługi te umożliwiają takie funkcje, jak analiza wideo w czasie rzeczywistym, planowanie robotyki i automatyczne przetwarzanie danych.
Platforma w centrum uwagi: od eksperymentów do produkcji
Aktualizacje pozycjonują Google Cloud AI Hypercomputer jako platformę pełnego stosu do przenoszenia obciążeń AI z badań do produkcji. Dzięki ściśle zintegrowanym możliwościom obliczeniowym, sieciowym, programowym i bezpieczeństwa, platforma została zaprojektowana z myślą o obsłudze systemów agentowych na dużą skalę, automatyki przemysłowej i aplikacji AI w czasie rzeczywistym.




Amazon