Firma NVIDIA ogłosiła dzisiaj, że z pomocą swoich globalnych partnerów wprowadza na rynek nowe systemy NVIDIA HGX A100. Nowe systemy mają przyspieszyć rozwój sztucznej inteligencji (AI) i obliczeń o wysokiej wydajności (HPC) poprzez dodanie elementów NVIDIA, takich jak karta graficzna NVIDIA A100 80 GB PCIe, karta sieciowa NVIDIA NDR 400G InfiniBand oraz oprogramowanie NVIDIA Magnum IO GPUDirect Storage. Nowe systemy HGX zostaną wprowadzone na rynek przez partnerów, takich jak Atos, Dell Technologies, Hewlett Packard Enterprise (HPE), Lenovo, Microsoft Azure i NetApp.
NVIDIA od lat produkuje wydajne procesory graficzne (GPU). Rozwijający się rynek sztucznej inteligencji (AI), szczególnie w dziedzinie obliczeń o wysokiej wydajności (HPC), sprawił, że coraz więcej superkomputerów korzysta z technologii firmy. Sama NVIDIA od kilku lat produkuje serwery i stacje robocze HPC, oferując modele DGX i HGX. Ten ostatni połączył kilka rozwiązań NVIDIA pod jednym dachem, aby zapewnić lepszą wydajność. Nowe systemy robią to po raz kolejny, wykorzystując najnowsze i najlepsze rozwiązania firmy NVIDIA.
Karta graficzna NVIDIA A100 80 GB PCIe
Procesor NVIDIA A100 został zaprezentowany w zeszłym roku na targach GTC. Ten nowy, 7-nanometrowy procesor graficzny wykorzystuje architekturę Ampere firmy i zawiera 54 miliony tranzystorów. NVIDIA szybko ulepszyła produkt, wprowadzając procesor graficzny NVIDIA A100 80 GB PCIe, podwajając jego pamięć. Procesor graficzny A100 80 GB PCIe jest pierwszym elementem nowych systemów HGX A100. Jego duża pojemność pamięci i wysoka przepustowość pozwalają na przechowywanie większej ilości danych i większych sieci neuronowych w pamięci. Oznacza to mniej komunikacji międzywęzłowej i mniejsze zużycie energii. Duża pamięć zapewnia również wyższą przepustowość, co może prowadzić do szybszych rezultatów.
Jak wspomniano, karta graficzna NVIDIA A100 80 GB PCIe jest oparta na architekturze Ampere. Architektura ta charakteryzuje się obsługą wielu instancji GPU, zwanych również MIG. Technologia MIG umożliwia przyspieszenie mniejszych obciążeń, np. wnioskowania AI. Funkcja ta pozwala użytkownikom na skalowanie w dół zarówno zasobów obliczeniowych, jak i pamięci, z gwarantowaną jakością usług (QoS).
Wśród partnerów projektujących kartę graficzną NVIDIA A100 80 GB PCIe znajdują się firmy Atos, Cisco, Dell Technologies, Fujitsu, H3C, HPE, Inspur, Lenovo, Penguin Computing, QCT i Supermicro. Technologię tę oferuje również kilka usług chmurowych, w tym AWS, Azure i Oracle.
Sieć NVIDIA NDR 400G InfiniBand
Drugim elementem układanki systemu NVIDIA HGX A100 są nowe systemy przełączników NVIDIA NDR 400G InfiniBand. Może to zabrzmieć trochę oczywisto, ale systemy HPC wymagają bardzo wysokiej przepustowości danych. NVIDIA przejęła Mellanox kilka lat temu za prawie 7 miliardów dolarów . Od tego czasu systematycznie wypuszcza nowe produkty, jednocześnie stopniowo wycofując nazwę Mellanox na rzecz samej NVIDIA. W zeszłym roku wypuszczono NVIDIA NDR 400G InfiniBand z trzykrotnie większą gęstością portów i 32-krotnie większą akceleracją AI. Jest on integrowany z nowymi systemami HGX za pośrednictwem systemu przełączników o stałej konfiguracji NVIDIA Quantum-2. System ten ma dostarczać 64 porty NDR 400 Gb/s InfiniBand na port lub 128 portów NDR200.
Według firmy, nowe modularne przełączniki NVIDIA Quantum-2 zapewniają skalowalną konfigurację portów, aż do 2,048 portów NDR 400 Gb/s InfiniBand (lub 4,096 portów NDR200) z całkowitą przepustowością dwukierunkową 1.64 petabita na sekundę. Stanowi to ponad 5-krotny wzrost w porównaniu z poprzednią generacją i 6.5-krotnie większą skalowalność. Dzięki topologii sieci DragonFly+ użytkownicy mogą połączyć się z ponad milionem węzłów. Firma dodała również technologię redukcji danych NVIDIA SHARP In-Network Computing trzeciej generacji, która – jak twierdzi – zapewnia 32-krotnie większą akcelerację AI w porównaniu z poprzednimi generacjami.
Przełączniki NVIDIA Quantum-2 są kompatybilne zarówno wstecz, jak i w przyszłości. Partnerami produkcyjnymi są Atos, DDN, Dell Technologies, Excelero, GIGABYTE, HPE, Lenovo, Penguin, QCT, Supermicro, VAST i WekaIO.
Magnum IO GPUDirect Storage
Ostatnim elementem układanki nowej karty graficznej NVIDIA HDX A100 jest nowa pamięć masowa Magnum IO GPUDirect. Umożliwia ona bezpośredni dostęp do pamięci między pamięcią GPU a pamięcią masową. Ma to szereg zalet, takich jak niższe opóźnienia wejścia/wyjścia, oszczędne wykorzystanie przepustowości kart sieciowych oraz mniejszy wpływ na procesor. Kilku partnerów oferuje już pamięć masową Magnum IO GPUDirect, w tym DDN, Dell Technologies, Excelero, HPE, IBM Storage, Micron, NetApp, Pavilion, ScaleFlux, VAST i WekaIO.




Amazon