StorageReview.com

Síťová technologie NVIDIA Spectrum-X pohání superpočítač Colossus od xAI

AI  ◇  Enterprise

Společnost NVIDIA oznámila, že superpočítač Colossus od společnosti xAI, který se pyšní pozoruhodnými 100 000 grafickými procesory NVIDIA Hopper Tensor Core, je nyní plně funkční v Memphisu v Tennessee. Tohoto úspěchu bylo dosaženo díky síťové platformě NVIDIA Spectrum-X™ Ethernet, která je navržena tak, aby poskytovala robustní výkon pro hyperscale datová centra s více nájemníky a umělou inteligencí. Spectrum-X využívá standardizovaný Ethernet se sítí RDMA k zajištění efektivní komunikace a optimalizovaného zpracování dat v těchto rozsáhlých prostředích.

Přepínač superpočítače Colossus

Jako největší superpočítač umělé inteligence na světě v současné době Colossus zajišťuje trénování rodiny jazykových modelů Grok od společnosti xAI, která zahrnuje funkce chatbotů pro předplatitele X Premium. Společnost xAI dále plánuje rozšířit systém Colossus na 200 000 grafických procesorů NVIDIA Hopper, čímž posílí své postavení předního zdroje pro výpočetní techniku ​​v oblasti umělé inteligence. Společnosti xAI a NVIDIA vybudovaly toto zařízení a pokročilou výpočetní infrastrukturu za rekordních 122 dní, zatímco podobné projekty obvykle trvají několik měsíců až let. Společnost Colossus zahájila trénovací operace do 19 dnů od počáteční instalace racku.

Colossus dosahuje výjimečného síťového výkonu při trénování rozsáhlých modelů a těží z řízení přetížení a zpracování toku dat Spectrum-X. Výsledkem je, že systém nezaznamenává nulovou latenci ani ztrátu paketů v důsledku kolizí toku dat a udržuje si propustnost dat 95 %, což je významné zlepšení oproti tradičnímu Ethernetu, který obvykle zaznamenává pouze 60% propustnost dat a časté kolize toku dat.

Pokrok implementace Spectrum-X od NVIDIA spočívá v jejím přístupu k řešení přetížení sítě v tomto masivním clusteru GPU. Tradiční ethernetové sítě se potýkají s problémem „incastu“, kdy tisíce GPU komunikují současně, což vede k výpadkům paketů a výraznému snížení výkonu. Zatímco InfiniBand tento problém tradičně řešil pomocí vestavěného řízení prioritního toku (PFC) a správy přetížení na hardwarové úrovni, Spectrum-X dosahuje podobných výsledků pomocí RoCE v2 s vylepšenými mechanismy řízení přetížení. To umožňuje xAI zachovat výkonnostní charakteristiky podobné InfiniBandu a zároveň využít cenové výhody a flexibilitu standardní ethernetové infrastruktury.

Adaptivní směrování a funkce přímého umisťování dat (Direct Data Placement) systému Spectrum-X vytvářejí odolnou síťovou strukturu, která zvládne masivní vzorce provozu ve směru východ-západ, typické pro distribuované tréninkové úlohy umělé inteligence. Výsledkem je systém, který si udržuje konzistentně nízkou latenci a vysokou propustnost, i když se všech 100 000 GPU aktivně podílí na kolektivních operacích.

Gilad Shainer, senior viceprezident pro sítě společnosti NVIDIA, zdůraznil, že „umělá inteligence je kriticky důležitá“ a vyžaduje kombinaci výkonu, zabezpečení, škálovatelnosti a nákladové efektivity. Zdůraznil, jak platforma Spectrum-X od společnosti NVIDIA umožňuje společnostem, jako je xAI, zrychlit zpracování, analýzu a provádění úloh s umělou inteligencí, což vede k rychlejšímu vývoji a nasazování řešení s umělou inteligencí.

Mluvčí společnosti xAI uznal grafické procesory Hopper a technologii Spectrum-X od společnosti NVIDIA a uvedl, že rozsah a výkon systému jsou klíčové pro umožnění optimalizované „továrny“ umělé inteligence založené na ethernetových standardech.

Ústředním bodem Spectrum-X je ethernetový přepínač Spectrum SN5600, který s integrovaným obvodem ASIC přepínače Spectrum-4 podporuje rychlosti až 800 Gb/s. Společnost xAI strategicky spárovala tento přepínač s kartami NVIDIA BlueField-3® SuperNIC, čímž dosáhla úrovní výkonu, které byly dříve exkluzivní pro InfiniBand. Ethernetové sítě Spectrum-X zavádějí funkce, jako je adaptivní směrování s přímým umístěním dat (Direct Data Placement), sofistikované řízení přetížení a vylepšená viditelnost a izolace výkonu v prostředí umělé inteligence (AI fabric) – splňující tak náročné požadavky prostředí s více klienty a nasazení umělé inteligence na podnikové úrovni.

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Harold Fritts

V technologickém průmyslu působím od doby, kdy IBM založila Selectric. Mám ale zkušenosti s psaním. Rozhodl jsem se tedy opustit předprodejní byznys a vrátit se ke svým kořenům, trochu psát, ale stále se věnovat technologiím.