StorageReview.com

CoreWeave nasazuje vícerackový cluster Vera Rubin NVL72: Stovky grafických procesorů Rubin, 1.6 Tb/s na grafický procesor a bezplatná archivační úroveň

mrak  ◇  Enterprise

Společnost CoreWeave nasadila v cloudu CoreWeave cloud s více racky clustery NVIDIA Vera Rubin NVL72 , které propojují stovky grafických procesorů Rubin do jednoho škálovatelného prostředí zaměřeného na úlohy agentní umělé inteligence. Každý rack od společnosti Dell obsahuje 72 grafických procesorů Rubin, 36 procesorů Vera, síť NVLink 6 jako škálovatelnou strukturu, procesory BlueField-4 a dvě síťové karty ConnectX-9 SuperNIC na každou grafickou kartu. Racky se propojují přes ethernet NVIDIA Spectrum-X v rámci dvouvrstvé, neblokující struktury, kterou CoreWeave uvádí jako škálovatelnou na zhruba 128 000 grafických procesorů. CoreWeave je prvním cloudovým poskytovatelem, který ověřil a uvedl na trh jediný Vera Rubin NVL72, a prvním, kdo publikoval naměřený výkon z jednoho racku. První recenzovaná čísla platformy se objevila minulý týden v MLPerf Inference v6.1 , kde CoreWeaveův vlastní projekt běžel na GB300 NVL72. Kromě výpočetních výkonů získává CoreWeave AI Object Storage zrychlení zápisu napříč regiony a novou archivační vrstvu.

Dva rozvaděče Dell NVIDIA Vera Rubin NVL72, propojené kabely a napájené v datovém centru CoreWeave, s přepínací vrstvou nahoře, výpočetními přihrádkami uprostřed a napájecími poličkami dole, foto s laskavým svolením CoreWeave.

Architektura NVIDIA Vera Rubin NVL72 pro více racků

Víceracková konstrukce se zaměřuje na cesty agentního provádění, kde smyčky sériového uvažování a volání externích nástrojů zvyšují latenci přístupu k datům v distribuované infrastruktuře. Dva superNICy ConnectX-9 na každém grafickém procesoru Rubin poskytují až 1.6 Tb/s síťového připojení backendu na jeden grafický procesor napříč víceramennými a vícerovinnými cestami a CoreWeave popisuje strukturu jako modulární, takže se další racky NVL72 připojují ke stejné neblokující topologii s rostoucí kapacitou. Racky jsou chlazeny kapalinou o teplotě 45 °C.

CoreWeave propojuje racky pomocí softwaru Mission Control. Řídicí jednotka životního cyklu racků (Rack LifeCycle Controller) zajišťuje zřizování a životní cyklus každého racku, detekci hardwaru prostřednictvím aktualizace firmwaru, validaci, napájení a tepelné smyčky; vrstva správy racků s názvem Racky řídí napájení a infrastrukturu; a programovatelná chladicí jednotka s názvem Valvey poskytuje softwarově definovaný přehled a kontrolu nad smyčkami kapalinového chlazení a senzory prostředí.

Racky se dostanou do produkčního prostředí až po fázovaném ověřování. Na úrovni uzlů to znamená hodiny opakované diagnostiky GPU, kontrol přenosu mezi CPU a GPU, validace propojení a teploty pod zátěží a realistické tréninkové běhy. Na úrovni racku synchronizované úlohy napříč všemi 72 GPU ověřují výkon NVLink mezi GPU a jakýkoli systém, který klesne pod očekávaný rozsah, je veden k řešení problémů. Napříč racky CoreWeave spouští distribuované úlohy, záměrně deaktivuje cesty NVLink, aby vynutil provoz přes backendovou síť, a sleduje fyzickou strukturu, zda nevykazuje nestabilní spojení, rostoucí chybovost, přehřívaný hardware a nerovnoměrný provoz, se vzorci zátěže, které napodobují agentní aplikace: náhlé nárůsty poptávky, měnící se souběžnost a výbuchy komunikace. Článek CoreWeave o vícerackovém provozu prochází každou fází a je zajímavým čtením.

Aktualizace úložiště objektů AI: Zápisy napříč regiony a archivační úroveň

Úložná část je postavena na platformě CoreWeave AI Object Storage a jejím Local Object Transport Accelerator (LOTA), což je proxy pro ukládání do mezipaměti, která běží na každém uzlu GPU a CPU v rámci služby CoreWeave Kubernetes Service a uchovává objekty na lokálním NVMe úložišti uzlu. CoreWeave uvádí rychlost čtení z mezipaměti až 7 GB/s na GPU s latencí čtení p99 více než 8krát nižší než čtení z úložiště a uvádí jednoho poskytovatele modelu Frontier, který provozuje LOTA na více než 15 000 GPU a 20 PB mezipaměti s mírou úspěšnosti 99.7 procenta. LOTA není zpoplatněna žádnými dalšími poplatky.

Akcelerace zápisu napříč oblastmi umožňuje aplikaci zapisovat do kontejneru ve vzdálené oblasti s lokální latencí bez změn API nebo SDK. Aplikace vydá standardní zápis S3 do koncového bodu LOTA; data objektu se trvale uloží do lokální oblasti, zatímco metadata se potvrdí do vzdálené oblasti; objekt je okamžitě čitelný, a to i úlohou, která jej zapisovala; a data migrují do vzdálené oblasti na pozadí. Aplikace vidí jeden jmenný prostor kontejnerů napříč oblastmi s jednotnými politikami IAM, pravidly životního cyklu a řízením přístupu, což eliminuje větvení a replikační kanály pro jednotlivé oblasti, které obvykle vyžaduje distribuce kontrolních bodů napříč lokalitami.

„Naše datové sady se rozprostírají v několika regionech a nemůžeme si dovolit, aby náš tréninkový harmonogram diktovaly zpoždění načítání dat mezi regiony,“ uvedla Cécile Robert-Michon, ředitelka interní infrastruktury ve společnosti Cohere. „CoreWeave AI Object Storage nám poskytuje jednotnou stopu datové sady napříč regiony s lokálně uloženými čteními v mezipaměti, takže nic nečeká v síti.“

Archivní vrstva je čtvrtou třídou úložiště vedle úrovní Hot, Warm a Cold, určenou pro data, která se zapisují jednou a čtou jen zřídka, jako jsou starší trénovací kontrolní body a nezpracované datové sady. Má nižší ceny za základní kapacitu a ruší poplatky za načítání, mezipaměť, poplatky za požadavek, včasné mazání, vrstvy a výstup. Vzor navržený společností CoreWeave uchovává nedávné kontrolní body v rychlejších vrstvách pro okamžité restartování a automaticky je přeřazuje do archivu po 60 dnech bez čtení. Zápisy mezi oblastmi i archivní vrstva jsou nyní k dispozici; podrobnosti o konfiguraci naleznete v příspěvku o úložišti od CoreWeave.

Stránka produktu CoreWeave GPU Compute

Stránka produktu CoreWeave pro úložiště objektů s umělou inteligencí

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Harold Fritts

V technologickém průmyslu působím od doby, kdy IBM založila Selectric. Mám ale zkušenosti s psaním. Rozhodl jsem se tedy opustit předprodejní byznys a vrátit se ke svým kořenům, trochu psát, ale stále se věnovat technologiím.