StorageReview.com

NVIDIA oferuje podgląd tego, co będzie dalej z fabrykami AI o mocy gigawatów na szczycie OCP Global Summit

AI  ◇  Enterprise

Firma NVIDIA ogłosiła specyfikację serwerów rackowych o otwartej architekturze Vera Rubin NVL144 generacji MGX. Ponad 50 partnerów MGX przygotowuje się do tej wersji, a ekosystem obsługuje NVIDIA Kyber, który łączy 576 procesorów graficznych Rubin Ultra i został zaprojektowany, aby sprostać rosnącym wymaganiom w zakresie inferencji.

We wrześniu firma NVIDIA ogłosiła rozszerzenie partnerstwa z firmą Intel . Jednocześnie Intel zaprezentował nowe procesory Xeon 6, z których jeden będzie pełnił funkcję procesora hosta dla NVIDIA DGX B300, najnowszej generacji systemów akcelerowanych przez AI. NVIDIA DGX B300 integruje procesor Intel Xeon 6776P, który odgrywa kluczową rolę w zarządzaniu, koordynacji i obsłudze systemu akcelerowanego przez AI. Dzięki dużej pojemności pamięci i przepustowości, Xeon 6776P zaspokaja rosnące potrzeby modeli i zestawów danych AI.

Procesor Xeon 6776P został zaprojektowany jako procesor „host GPU” z funkcjami Priority Core Turbo (PCT) i Intel Speed ​​Select-Turbo Frequency (SST‑TF), dzięki czemu niewielki zestaw rdzeni może zwiększyć taktowanie i obsługiwać orkiestrację wrażliwą na opóźnienia, podczas gdy pozostałe rdzenie pracują z taktowaniem bazowym. Pomaga to zwiększyć efektywne wykorzystanie GPU w klastrach NVLink poprzez redukcję przestojów w przetwarzaniu wstępnym, obsłudze pamięci podręcznej KV i harmonogramowaniu.

Vera Rubin NVL144: Zaprojektowany z myślą o skalowalności dla fabryk AI

Platforma obliczeniowa Vera Rubin NVL144 MGX charakteryzuje się energooszczędną, w pełni chłodzoną cieczą, modułową konstrukcją. Jej centralna płytka drukowana (middleplane) zastępuje konwencjonalne połączenia kablowe, umożliwiając szybszy montaż i łatwiejszą konserwację. Zawiera również modułowe gniazda rozszerzeń dla sieci NVIDIA ConnectX-9 800 GB/s i NVIDIA Rubin CPX, obsługujące zadania wnioskowania na dużą skalę.

Karta NVIDIA Vera Rubin NVL144 stanowi znaczący postęp w dziedzinie architektury akcelerowanych obliczeń i możliwości sztucznej inteligencji. Została zaprojektowana z myślą o obsłudze zaawansowanych silników wnioskowania i zaspokajaniu potrzeb agentów AI.

Główna konstrukcja oparta jest na architekturze rack MGX i będzie obsługiwana przez ponad 50 partnerów w zakresie systemów i komponentów MGX. NVIDIA zamierza udostępnić ulepszone innowacje w zakresie racków i tacek obliczeniowych jako otwarty standard dla konsorcjum OCP.

Standardy dotyczące tac i szaf komputerowych umożliwiają partnerom montaż systemów modułowych i szybszą skalowalność wraz z architekturą. Konstrukcja szafy Vera Rubin NVL144 charakteryzuje się energooszczędnym chłodzeniem cieczą o temperaturze 45°C, nową szyną zbiorczą chłodzoną cieczą dla lepszej wydajności oraz 20-krotnie większym magazynowaniem energii, zapewniającym stabilność zasilania.

Udoskonalenia MGX w zakresie architektury tac i stojaków obliczeniowych zwiększają wydajność fabryki AI i ułatwiają montaż, umożliwiając szybką skalowalność do infrastruktury AI na poziomie gigawatów.

Ekosystem NVIDIA NVLink Fusion rozszerza się

Oprócz rozwiązań sprzętowych, coraz większą popularność zyskuje technologia NVIDIA NVLink Fusion, umożliwiając firmom bezproblemową integrację częściowo niestandardowych układów scalonych z wysoce zoptymalizowaną, szeroko wdrażaną architekturą centrów danych, co pozwala ograniczyć złożoność i skrócić czas wprowadzania produktów na rynek.

Intel i Samsung Foundry dołączają do ekosystemu NVLink Fusion, który obejmuje projektantów niestandardowych układów scalonych, partnerów zajmujących się procesorami i protokołami IP. Dzięki temu fabryki AI mogą szybko skalować i zarządzać intensywnymi obciążeniami w celu trenowania modeli i wnioskowania agentowego AI.

  • W ramach niedawno ogłoszonego Współpraca firm NVIDIA i Intel, Firma Intel będzie produkować procesory x86, które zintegrują się z platformami infrastrukturalnymi NVIDIA przy użyciu technologii NVLink Fusion.
  • Samsung Foundry nawiązało współpracę z firmą NVIDIA, aby sprostać rosnącemu zapotrzebowaniu na niestandardowe procesory CPU i niestandardowe układy XPU, oferując doświadczenie w projektowaniu i produkcji niestandardowych układów scalonych.

NVIDIA Kyber Rack

Ponad 20 partnerów branżowych prezentuje nowe układy scalone, komponenty, systemy zasilania oraz wsparcie dla centrów danych nowej generacji o napięciu 800 V prądu stałego (VDC). Centra te, zaprojektowane z myślą o erze gigawatów, będą obsługiwać architekturę stelażową Kyber firmy NVIDIA.

Foxconn udostępnił szczegóły dotyczące swojego 40-megawatowego tajwańskiego centrum danych Kaohsiung-1, które jest budowane z myślą o erze 800 V DC. Inni liderzy branży, w tym CoreWeave, Lambda, Nebius, Oracle Cloud Infrastructure i Together AI, również planują centra danych z myślą o infrastrukturze 800 V. Ponadto, Vertiv wprowadził architekturę referencyjną MGX 800 V DC, rozwiązanie zaprojektowane z myślą o optymalizacji przestrzeni, kosztów i efektywności energetycznej, oferując jednocześnie kompletną infrastrukturę zasilania i chłodzenia. Jednocześnie HPE wspiera produkty dla technologii skalowania poziomego NVIDIA Kyber i NVIDIA Spectrum-XGS Ethernet, które są integralnymi elementami platformy Spectrum-X Ethernet.

Przejście z konwencjonalnych systemów trójfazowych 415 lub 480 VAC na infrastrukturę 800 VDC oferuje większą skalowalność, lepszą efektywność energetyczną, mniejsze zużycie materiałów i lepszą wydajność w centrach danych. Sektory pojazdów elektrycznych i energii słonecznej wdrożyły już infrastrukturę 800 VDC, aby osiągnąć te korzyści.

Generacja serwerów rackowych NVIDIA Kyber

Ekosystem OCP przygotowuje się również na technologię NVIDIA Kyber, która charakteryzuje się innowacjami w zakresie zasilania prądem stałym o napięciu 800 V, chłodzenia cieczą i konstrukcji mechanicznej.

Te innowacje ułatwią przejście na generację serwerów rackowych NVIDIA Kyber, następcę NVIDIA Oberon, który ma być wyposażony w platformę o wysokiej gęstości z 576 procesorami graficznymi NVIDIA Rubin Ultra do 2027 roku.

Najlepszym sposobem na rozwiązanie problemów z dystrybucją dużej mocy jest podniesienie napięcia. Przejście ze standardowego trójfazowego systemu 415 lub 480 VAC na system 800 VDC oferuje szereg korzyści.

Trwająca transformacja umożliwia partnerom w zakresie serwerów rackowych modernizację komponentów z 54 V DC do 800 V DC, co przekłada się na poprawę wydajności. Podczas wydarzenia, ekosystem współpracujących ze sobą dostawców infrastruktury prądu stałego, partnerów w zakresie systemów zasilania i chłodzenia oraz producentów układów scalonych pracował wspólnie nad otwartymi standardami dla referencyjnej architektury serwerów rackowych MGX.

NVIDIA Kyber ma na celu zwiększenie gęstości procesorów GPU w szafach rack, zwiększenie przepustowości sieci i optymalizację wydajności systemów AI na dużą skalę. Oferuje pionowy montaż modułów obliczeniowych typu blade, obsługując do 18 modułów w obudowie. Co więcej, specjalistyczne moduły przełączające NVLink firmy NVIDIA są umieszczone z tyłu obudowy za pośrednictwem bezprzewodowo zintegrowanej płyty środkowej, co zapewnia płynną, skalowalną łączność sieciową.

Ponad 150% więcej mocy jest przesyłane przez tę samą miedź przy napięciu 800 V DC, co eliminuje konieczność stosowania 200-kilogramowych miedzianych szyn zbiorczych do zasilania pojedynczej szafy.

Kyber ma stać się kluczowym elementem hiperskalowych centrów danych AI, zwiększając wydajność, efektywność i niezawodność zaawansowanych zadań generatywnej AI. Szafy NVIDIA Kyber pozwalają klientom znacząco zmniejszyć zużycie miedzi, co przekłada się na miliony dolarów oszczędności.

Skalowanie nowej generacji fabryk AI

Ponad 20 partnerów firmy NVIDIA pomaga dostarczać serwery typu rack zgodne z otwartymi standardami, umożliwiając budowę przyszłych fabryk AI o mocy gigawatów.

  • Dostawcy krzemu:Analog Devices, Inc. (ADI), TO, EPC, Infineon, Innoscience, MPS, Navitas, onsemi, Power Integrations, Renesas, Richtek, ROHM, STMicroelectronics i Texas Instruments
  • Dostawcy komponentów systemu zasilania:Bizlink, Delta, Przewód, GE Vernova, Lead Wealth, LITEON i Megmeet
  • Dostawcy systemów zasilania centrów danych: ABB, Eaton, GE Vernova, Heron Power, Hitachi Energy, Mitsubishi Electric, Schneider Electric, Siemens i Vertiv

NVIDIA jest wiodącym współtwórcą standardów OCP w wielu generacjach sprzętu, w tym kluczowych elementów elektromechanicznej konstrukcji systemu NVIDIA GB200 NVL72. Ta sama obudowa MGX obsługuje GB300 NVL72 i będzie obsługiwać Vera Rubin NVL144, Vera Rubin NVL144 CPX i Vera Rubin CPX, co zapewnia wyższą wydajność i szybsze wdrożenia.

Skontaktuj się z StorageReview

Biuletyn | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Kanał RSS

Harold Fritts

Pracuję w branży technologicznej od czasu, gdy IBM stworzyło Selectric. Moim głównym zajęciem jest jednak pisanie. Postanowiłem więc odejść z działu przedsprzedaży i wrócić do korzeni, zajmując się trochę pisaniem, ale wciąż angażując się w technologię.