Společnost CoreWeave nasadila v cloudu CoreWeave cloud s více racky clustery NVIDIA Vera Rubin NVL72 , které propojují stovky grafických procesorů Rubin do jednoho škálovatelného prostředí zaměřeného na úlohy agentní umělé inteligence. Každý rack od společnosti Dell obsahuje 72 grafických procesorů Rubin, 36 procesorů Vera, síť NVLink 6 jako škálovatelnou strukturu, procesory BlueField-4 a dvě síťové karty ConnectX-9 SuperNIC na každou grafickou kartu. Racky se propojují přes ethernet NVIDIA Spectrum-X v rámci dvouvrstvé, neblokující struktury, kterou CoreWeave uvádí jako škálovatelnou na zhruba 128 000 grafických procesorů. CoreWeave je prvním cloudovým poskytovatelem, který ověřil a uvedl na trh jediný Vera Rubin NVL72, a prvním, kdo publikoval naměřený výkon z jednoho racku. První recenzovaná čísla platformy se objevila minulý týden v MLPerf Inference v6.1 , kde CoreWeaveův vlastní projekt běžel na GB300 NVL72. Kromě výpočetních výkonů získává CoreWeave AI Object Storage zrychlení zápisu napříč regiony a novou archivační vrstvu.
Architektura NVIDIA Vera Rubin NVL72 pro více racků
Víceracková konstrukce se zaměřuje na cesty agentního provádění, kde smyčky sériového uvažování a volání externích nástrojů zvyšují latenci přístupu k datům v distribuované infrastruktuře. Dva superNICy ConnectX-9 na každém grafickém procesoru Rubin poskytují až 1.6 Tb/s síťového připojení backendu na jeden grafický procesor napříč víceramennými a vícerovinnými cestami a CoreWeave popisuje strukturu jako modulární, takže se další racky NVL72 připojují ke stejné neblokující topologii s rostoucí kapacitou. Racky jsou chlazeny kapalinou o teplotě 45 °C.
CoreWeave propojuje racky pomocí softwaru Mission Control. Řídicí jednotka životního cyklu racků (Rack LifeCycle Controller) zajišťuje zřizování a životní cyklus každého racku, detekci hardwaru prostřednictvím aktualizace firmwaru, validaci, napájení a tepelné smyčky; vrstva správy racků s názvem Racky řídí napájení a infrastrukturu; a programovatelná chladicí jednotka s názvem Valvey poskytuje softwarově definovaný přehled a kontrolu nad smyčkami kapalinového chlazení a senzory prostředí.
Racky se dostanou do produkčního prostředí až po fázovaném ověřování. Na úrovni uzlů to znamená hodiny opakované diagnostiky GPU, kontrol přenosu mezi CPU a GPU, validace propojení a teploty pod zátěží a realistické tréninkové běhy. Na úrovni racku synchronizované úlohy napříč všemi 72 GPU ověřují výkon NVLink mezi GPU a jakýkoli systém, který klesne pod očekávaný rozsah, je veden k řešení problémů. Napříč racky CoreWeave spouští distribuované úlohy, záměrně deaktivuje cesty NVLink, aby vynutil provoz přes backendovou síť, a sleduje fyzickou strukturu, zda nevykazuje nestabilní spojení, rostoucí chybovost, přehřívaný hardware a nerovnoměrný provoz, se vzorci zátěže, které napodobují agentní aplikace: náhlé nárůsty poptávky, měnící se souběžnost a výbuchy komunikace. Článek CoreWeave o vícerackovém provozu prochází každou fází a je zajímavým čtením.
Aktualizace úložiště objektů AI: Zápisy napříč regiony a archivační úroveň
Úložná část je postavena na platformě CoreWeave AI Object Storage a jejím Local Object Transport Accelerator (LOTA), což je proxy pro ukládání do mezipaměti, která běží na každém uzlu GPU a CPU v rámci služby CoreWeave Kubernetes Service a uchovává objekty na lokálním NVMe úložišti uzlu. CoreWeave uvádí rychlost čtení z mezipaměti až 7 GB/s na GPU s latencí čtení p99 více než 8krát nižší než čtení z úložiště a uvádí jednoho poskytovatele modelu Frontier, který provozuje LOTA na více než 15 000 GPU a 20 PB mezipaměti s mírou úspěšnosti 99.7 procenta. LOTA není zpoplatněna žádnými dalšími poplatky.
Akcelerace zápisu napříč oblastmi umožňuje aplikaci zapisovat do kontejneru ve vzdálené oblasti s lokální latencí bez změn API nebo SDK. Aplikace vydá standardní zápis S3 do koncového bodu LOTA; data objektu se trvale uloží do lokální oblasti, zatímco metadata se potvrdí do vzdálené oblasti; objekt je okamžitě čitelný, a to i úlohou, která jej zapisovala; a data migrují do vzdálené oblasti na pozadí. Aplikace vidí jeden jmenný prostor kontejnerů napříč oblastmi s jednotnými politikami IAM, pravidly životního cyklu a řízením přístupu, což eliminuje větvení a replikační kanály pro jednotlivé oblasti, které obvykle vyžaduje distribuce kontrolních bodů napříč lokalitami.
„Naše datové sady se rozprostírají v několika regionech a nemůžeme si dovolit, aby náš tréninkový harmonogram diktovaly zpoždění načítání dat mezi regiony,“ uvedla Cécile Robert-Michon, ředitelka interní infrastruktury ve společnosti Cohere. „CoreWeave AI Object Storage nám poskytuje jednotnou stopu datové sady napříč regiony s lokálně uloženými čteními v mezipaměti, takže nic nečeká v síti.“
Archivní vrstva je čtvrtou třídou úložiště vedle úrovní Hot, Warm a Cold, určenou pro data, která se zapisují jednou a čtou jen zřídka, jako jsou starší trénovací kontrolní body a nezpracované datové sady. Má nižší ceny za základní kapacitu a ruší poplatky za načítání, mezipaměť, poplatky za požadavek, včasné mazání, vrstvy a výstup. Vzor navržený společností CoreWeave uchovává nedávné kontrolní body v rychlejších vrstvách pro okamžité restartování a automaticky je přeřazuje do archivu po 60 dnech bez čtení. Zápisy mezi oblastmi i archivní vrstva jsou nyní k dispozici; podrobnosti o konfiguraci naleznete v příspěvku o úložišti od CoreWeave.




Amazon