Továrny umělé inteligence vyžadují pro efektivní provoz více než jen vysoce výkonné výpočetní struktury. Zatímco sítě typu East-West hrají klíčovou roli v propojování GPU, stejně důležité jsou i úložné struktury – zodpovědné za propojení vysokorychlostních úložných polí. Výkon úložiště významně ovlivňuje více fází životního cyklu umělé inteligence, včetně kontrolních bodů pro trénování a inferenčních technik, jako je generování s rozšířeným načítáním (RAG). Aby společnost NVIDIA a její úložný ekosystém splnily tyto požadavky, rozšířily síťovou platformu NVIDIA Spectrum-X, aby zvýšily výkon úložných struktur a zkrátily dobu potřebnou k získání poznatků z umělé inteligence.
Pochopení síťových kolizí v klastrech umělé inteligence
Ke kolizím v síti dochází, když se více datových paketů pokouší projít stejnou síťovou cestou současně, což vede k rušení, zpožděním a občas i k nutnosti opětovného přenosu. V rozsáhlých klastrech umělé inteligence jsou takové kolize pravděpodobnější, když jsou grafické procesory plně vytížené nebo je provoz silně zatížen datově náročnými operacemi.
Protože grafické procesory (GPU) zpracovávají složité výpočty současně, mohou se síťové zdroje přesytit, což vede k úzkým místům v komunikaci. Spectrum-X je navržen tak, aby těmto problémům čelil automatickým a dynamickým přesměrováním provozu a řízením přetížení, čímž zajišťuje nepřerušovaný tok kritických dat bez nutnosti implementací, jako je například vylepšený ECMP od společnosti Meta popsaný v článku LLAMA 3.
Optimalizace výkonu úložiště pomocí Spectrum-X
NVIDIA Spectrum-X zavádí adaptivní směrovací funkce, které zmírňují kolize toků a optimalizují využití šířky pásma. Ve srovnání s RoCE v2, ethernetovým síťovým protokolem široce používaným ve výpočetních a úložných sítích umělé inteligence, dosahuje Spectrum-X vynikajícího úložného výkonu. Testy prokazují až 48% zlepšení šířky pásma pro čtení a 41% nárůst šířky pásma pro zápis. Tato vylepšení se promítají do rychlejšího provádění úloh umělé inteligence, zkrácení doby dokončení trénovacích úloh a minimalizace latence mezi tokeny pro inferenční úlohy.
S rostoucí složitostí úloh umělé inteligence se musí odpovídajícím způsobem vyvíjet i úložná řešení. Přední poskytovatelé úložišť, včetně DDN, VAST Data a WEKA, se spojili se společností NVIDIA, aby do svých úložných řešení integrovali Spectrum-X. Tato spolupráce umožňuje úložným sítím s umělou inteligencí využívat nejmodernější síťové funkce, což zvyšuje výkon a škálovatelnost.
Superpočítač Izrael-1: Ověření dopadu Spectrum-X
Společnost NVIDIA postavila generativní superpočítač s umělou inteligencí Israel-1 jako testovací prostředí pro optimalizaci výkonu Spectrum-X v reálných scénářích. Tým Israel-1 provedl rozsáhlé benchmarky, aby vyhodnotil vliv Spectrum-X na výkon úložné sítě. Pomocí benchmarku Flexible I/O Tester (FIO) porovnali standardní konfiguraci sítě RoCE v2 s povoleným adaptivním směrováním a řízením přetížení Spectrum-X.
Testy zahrnovaly konfigurace od 40 do 800 GPU a konzistentně prokazovaly vynikající výkon se Spectrum-X. Zlepšení šířky pásma pro čtení se pohybovalo od 20 % do 48 %, zatímco šířka pásma pro zápis se zvýšila o 9 % až 41 %. Tyto výsledky se úzce shodují se zlepšením výkonu pozorovaným u partnerských ekosystémových řešení a dále potvrzují účinnost technologie v úložných sítích s umělou inteligencí.
Role úložných sítí ve výkonu umělé inteligence
Efektivita úložné sítě je pro provoz umělé inteligence klíčová. Trénování modelů často trvá dny, týdny nebo dokonce měsíce, což vyžaduje pravidelné kontrolní body , aby se zabránilo ztrátě dat v důsledku selhání systému. Vzhledem k tomu, že rozsáhlé modely umělé inteligence dosahují kontrolních stavů v rozsahu terabajtů, efektivní správa úložné sítě zajišťuje bezproblémovou kontinuitu trénování.
Inferenční úlohy založené na RAG dále zdůrazňují důležitost vysoce výkonných úložných struktur. Kombinací LLM s dynamickou znalostní bází RAG zvyšuje přesnost odezvy bez nutnosti přetrénování modelu. Tyto znalostní báze, které jsou obvykle uloženy ve velkých vektorových databázích, vyžadují přístup k úložišti s nízkou latencí, aby se udržel optimální výkon inference, zejména v generativních prostředích umělé inteligence s více klienty, která zpracovávají velké objemy dotazů.
Aplikace adaptivního směrování a řízení přetížení v úložišti
Spectrum-X představuje klíčové inovace v oblasti ethernetových sítí adaptované z InfiniBandu pro zlepšení výkonu úložné sítě:
- Adaptivní směrováníSpectrum-X dynamicky vyvažuje síťový provoz, aby se zabránilo kolizím typu „elephant flow“ během kontrolních bodů a datově náročných operací. Ethernetové přepínače Spectrum-4 analyzují data o přetížení v reálném čase a pro každý paket vybírají nejméně přetíženou cestu. Na rozdíl od staršího Ethernetu, kde pakety mimo pořadí vyžadují opětovný přenos, Spectrum-X využívá SuperNIC a DPU k přeskupení paketů v cíli, což zajišťuje bezproblémový provoz a vyšší efektivní využití šířky pásma.
- Kontrola přetížení: Kontrolní stanoviště a další operace úložiště s využitím umělé inteligence často vedou k přetížení typu „mnoho na jednoho“, kdy se více klientů pokouší zapisovat do jednoho úložného uzlu. Spectrum-X tento problém zmírňuje regulací rychlosti vkládání dat pomocí hardwarové telemetrie, čímž zabraňuje vzniku bodů přetížení, které by mohly snížit výkon sítě.
Zajištění odolnosti úložných sítí s umělou inteligencí
Velké továrny umělé inteligence zahrnují rozsáhlou síť přepínačů, kabelů a transceiverů, takže odolnost je klíčovým faktorem pro udržení výkonu. Spectrum-X využívá globální adaptivní směrování k rychlému přesměrování provozu během výpadků spojení, minimalizuje narušení a zachovává optimální využití úložné struktury.
Bezproblémová integrace s NVIDIA AI Stack
Kromě hardwarových inovací Spectrum-X nabízí NVIDIA softwarová řešení pro urychlení pracovních postupů ukládání dat s využitím umělé inteligence. Patří mezi ně:
- NVIDIA AirCloudový simulační nástroj pro modelování přepínačů, SuperNIC a úložišť, zefektivnění nasazení a provozu.
- NVIDIA Cumulus LinuxSíťový operační systém s vestavěnou automatizací a podporou API pro efektivní správu ve velkém měřítku.
- NVIDIA DOCASDK pro SuperNIC a DPU, které poskytuje vylepšenou programovatelnost a výkon úložiště.
- NVIDIA NetQNástroj pro ověření sítě v reálném čase, který se integruje s telemetrií přepínače pro lepší přehled a diagnostiku.
- Úložiště NVIDIA GPUDirectTechnologie přímého přenosu dat optimalizující cesty mezi úložištěm a pamětí GPU pro lepší propustnost dat.
Integrací Spectrum-X do úložných sítí společnost NVIDIA a její partneři nově definují výkon infrastruktury umělé inteligence. Kombinace adaptivního síťování, řízení přetížení a optimalizace softwaru zajišťuje, že továrny umělé inteligence se mohou efektivně škálovat, což přináší rychlejší analýzy a vyšší provozní efektivitu.




Amazon