StorageReview.com

META představuje cluster s 24 576 GPU pro datová centra, který podpoří inovace v oblasti umělé inteligence

Enterprise

Společnost Meta pokračuje ve svých inovacích v oblasti umělé inteligence prostřednictvím strategických investic do hardwarové infrastruktury, která je klíčová pro rozvoj technologií umělé inteligence. Společnost nedávno zveřejnila podrobnosti o dvou iteracích svého clusteru s 24 576 GPU v datovém centru, který je klíčový pro vývoj modelů umělé inteligence nové generace, včetně vývoje Llama 3. Tato iniciativa je základem vize společnosti Meta, jejímž cílem je generovat otevřenou a zodpovědně budovanou obecnou umělou inteligenci (AGI) dostupnou všem.

Foto s laskavým svolením META Engineering

V rámci své pokračující cesty společnost Meta zdokonalila svůj AI Research SuperCluster (RSC), původně představený v roce 2022, s 16 000 grafickými procesory NVIDIA A100. RSC sehrál klíčovou roli v rozvoji výzkumu otevřené umělé inteligence a podpoře vytváření sofistikovaných modelů umělé inteligence s aplikacemi v mnoha oblastech, včetně počítačového vidění, zpracování přirozeného jazyka (NLP), rozpoznávání řeči a dalších.

Nové klastry umělé inteligence společnosti Meta, které staví na úspěších RSC, vylepšují komplexní vývoj systémů umělé inteligence s důrazem na optimalizaci zkušeností výzkumníků a vývojářů. Tyto klastry integrují 24 576 grafických procesorů NVIDIA Tensor Core H100 a využívají vysoce výkonné síťové struktury k podpoře složitějších modelů, než bylo dříve možné, čímž nastavují nový standard pro vývoj a výzkum produktů GenAI.

Infrastruktura společnosti Meta je vysoce pokročilá a přizpůsobivá a denně zvládá stovky bilionů spuštění modelů umělé inteligence. Zakázkový design hardwaru a síťových struktur zajišťuje optimalizovaný výkon pro výzkumníky v oblasti umělé inteligence a zároveň zachovává efektivní provoz datových center.

Byla implementována inovativní síťová řešení, včetně clusteru s remote direct memory access (RDMA) přes konvergovaný Ethernet (RoCE) a dalšího s fabricou NVIDIA Quantum2 InfiniBand, oba schopné propojení s rychlostí 400 Gb/s. Tyto technologie umožňují škálovatelnost a analýzu výkonu, což je klíčové pro návrh budoucích rozsáhlých clusterů umělé inteligence.

Grand Teton představen během OCP 2022

Meta Grand Teton, otevřená hardwarová platforma GPU navržená společností Meta, přispívá k projektu Open Compute Project (OCP) a ztělesňuje roky vývoje systémů umělé inteligence. Slučuje rozhraní pro napájení, řízení, výpočetní techniku ​​a fabric do uceleného celku, což usnadňuje rychlé nasazení a škálování v prostředí datových center.

Společnost Meta se zabývá často nedostatečně diskutovanou, ale klíčovou rolí úložiště v oblasti školení umělé inteligence a implementovala vlastní API Linux Filesystem in Userspace (FUSE) podporované optimalizovanou verzí distribuovaného úložného řešení „Tectonic“. Toto nastavení, ve spojení s paralelním síťovým souborovým systémem (NFS) vyvinutým společností Hammerspace, poskytuje škálovatelné a vysoce výkonné úložné řešení, které je nezbytné pro zvládání obrovských datových nároků multimodálních úkolů školení umělé inteligence.

Serverová platforma YV3 Sierra Point od společnosti Meta, podpořená řešeními Tectonic a Hammerspace, podtrhuje odhodlání společnosti k výkonu, efektivitě a škálovatelnosti. Tato prozíravost zajišťuje, že úložná infrastruktura dokáže splnit současné požadavky a škálovat se tak, aby vyhověla rostoucím potřebám budoucích iniciativ v oblasti umělé inteligence.

S rostoucí složitostí systémů umělé inteligence pokračuje Meta ve svých open-source inovacích v oblasti hardwaru a softwaru, čímž významně přispívá k OCP a PyTorch, a tím podporuje společný rozvoj v rámci výzkumné komunity umělé inteligence.

Návrhy těchto trénovacích clusterů pro umělou inteligenci jsou nedílnou součástí plánu společnosti Meta, jehož cílem je rozšířit její infrastrukturu s ambicí integrovat 350 000 grafických procesorů NVIDIA H100 do konce roku 2024. Tato trajektorie zdůrazňuje proaktivní přístup společnosti Meta k rozvoji infrastruktury, připravený splnit dynamické požadavky budoucího výzkumu a aplikací umělé inteligence.

Blog o metainženýrství

Zapojte se do StorageReview

Zpravodaj | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Harold Fritts

V technologickém průmyslu působím od doby, kdy IBM založila Selectric. Mám ale zkušenosti s psaním. Rozhodl jsem se tedy opustit předprodejní byznys a vrátit se ke svým kořenům, trochu psát, ale stále se věnovat technologiím.