StorageReview.com

Andromeda štandardizuje úložisko pre viac ako 50 poskytovateľov GPU na platforme WEKA NeuralMesh

podnik  ◇  Podnikové úložisko

Spoločnosť WEKA oznámila, že Andromeda, platforma, ktorá spája tímy umelej inteligencie s vysokovýkonnými výpočtami na otvorenom trhu poskytovateľov, integruje WEKA NeuralMesh ako základnú vrstvu úložiska dát pre svoje spravované klastre GPU. Zákazníci Andromedy si môžu vybrať medzi vyhradeným nasadením NeuralMesh a konfiguráciou NeuralMesh Axon s natívnou GPU, čo im poskytuje konzistentný výkon úložiska na akomkoľvek klastri bežiacom na akomkoľvek hyperscaleri alebo cloude umelej inteligencie.

Spoločnosť Andromeda pôsobí v rámci viac ako 50 poskytovateľov výpočtových služieb po celom svete, pričom smeruje tréningové a inferenčné pracovné zaťaženie prostredníctvom rastúcej flotily spravovaných klastrov a tvrdí, že obsluhuje viac ako 100 zákazníkov s umelou inteligenciou a podporuje miliardy hodín používania grafických procesorov (GPU). Každý klaster na platforme musí spĺňať rovnaké kritériá kvality bez ohľadu na to, kto prevádzkuje infraštruktúru, a Andromeda každý klaster certifikuje v oblasti GPU, úložiska, sieťovej infraštruktúry a zabezpečenia predtým, ako sa dostane k zákazníkovi. Tento štandard odhalil problém: každý poskytovateľ priniesol svoje vlastné úložné prostredie a výkon sa líšil v závislosti od klastra.

Ovládací panel WEKA NeuralMesh Observe zobrazujúci štyri klastre v rámci AWS, OCI a lokálnych prostredí s panelmi kapacity, priepustnosti, IOPS a latencie

Cieľom NeuralMesh je štandardizovať túto dátovú vrstvu. Pre Andromedu platforma poskytuje nasaditeľnú úložnú architektúru, ktorá je konzistentne konfigurovaná u rôznych poskytovateľov hardvéru, namiesto toho, aby sa spoliehala na natívnu implementáciu zdieľaného úložiska každého cloudu alebo dátového centra.

„Naším cieľom je umožniť globálny tok výpočtov, a to znamená, že každý klaster, ktorý dodáme, musí fungovať bez ohľadu na to, odkiaľ kapacita pochádza,“ povedal Wil Moushey, generálny riaditeľ spoločnosti Andromeda. „Štandardizácia WEKA NeuralMesh poskytla našim zákazníkom konzistenciu na úrovni hyperškálovateľného riešenia s flexibilitou otvoreného trhu na úrovni úložiska a pamäte, kde sa výkon získava alebo stráca. Nečinné grafické procesory brzdia tempo inovácií v oblasti umelej inteligencie. WEKA nám pomáha zabezpečiť, aby si každý grafický procesor, ktorý spravujeme, zaslúžil svoje miesto.“

Natívne úložisko GPU s NeuralMesh Axon

NeuralMesh Axon je natívne nasadenie softvérovej platformy NeuralMesh s grafickým procesorom. Spája úložisko priamo s GPU servermi Andromeda, čím prevádza existujúce NVMe každého klastra na jednotnú dátovú vrstvu, ktorá slúži na trénovanie a inferenciu. Z toho vyplýva ekonomický argument: hardvér je už namontovaný, napájaný a zaplatený, takže výkon je dosiahnutý bez zvýšenia priestorovej plochy, spotreby energie alebo nákladov. WEKA uvádza jeden prípad, keď výskumné laboratórium zistilo, že jeho pracovné zaťaženie je obmedzené úložiskom poskytovaným jeho klastrom, a Andromeda nasadila Axon na rovnaký hardvér namiesto pridania infraštruktúry.

Spoločnosť Andromeda používa operátor NeuralMesh Kubernetes na automatizáciu nasadzovania klastrov a správy ich životného cyklu. Spoločnosť uvádza, že nové klastre NeuralMesh Axon je možné nasadiť z holého počítača približne za 10 minút. Približne polovica jej nasadení NeuralMesh používa konfiguráciu Axon, zatiaľ čo zvyšok sú špecializované nasadenia pre zákazníkov, ktorí vyžadujú exkluzívne výpočtové a pamäťové zdroje GPU.

„Prvé nasadenie WEKA NeuralMesh Axon v spoločnosti Andromeda trvalo len 10 minút od holého železa. To sa stalo naším plánom,“ povedal Vishvajit Kher, hlavný architekt v spoločnosti Andromeda. „Ak poskytovateľ cloudu neponúka zdieľané úložisko, už nás to neblokuje. Nasadíme WEKA NeuralMesh a vieme, že bude fungovať. Je to plnohodnotný systém, až o 90 % lacnejší ako trhové alternatívy, ktorý prináša úspory, ktoré sa s rastúcim rozširovaním ešte znásobujú.“

Schéma architektúry WEKA NeuralMesh zobrazujúca prihlasovacie, kontrolné a výpočtové uzly Slurm spolu s dedikovanými backendovými servermi WEKA

Model nasadenia umožňuje spoločnosti Andromeda vytvárať spravované klastre GPU v prostrediach, kde poskytovatelia cloudu neponúkajú zdieľané úložisko. To rozširuje rozsah infraštruktúry poskytovateľov, ktorá spĺňa jej prevádzkové požiadavky.

Hlásené výsledky výroby

Andromeda uvádza, že klastre NeuralMesh Axon dosahujú celkovú priepustnosť viac ako 400 GB/s na klaster a v produkčných nasadeniach prekračujú 6 miliónov IOPS. V jednej biotechnologickej záťaži zahŕňajúcej súbory údajov s vysokým obsahom metadát a približne miliardou súborov na adresár platforma skrátila čas prenosu dát z hodín na minúty.

Spoločnosť tiež uvádza, že tímy umelej inteligencie využívajúce jej spravované klastre skrátili čas spustenia prostredia z približne troch minút na 30 sekúnd. Rýchlejšia inicializácia prostredia môže zvýšiť počet iterácií trénovania, testovania a inferencie, ktoré môžu tímy vykonať počas vývojového cyklu.

NeuralMesh obsahuje funkcie izolácie porúch, ktoré zabraňujú kaskádovaniu lokalizovaných porúch v rámci klastra. Pre poskytovateľov prevádzkujúcich prostredia s viacerými nájomníkmi GPU to pomáha udržiavať dostupnosť pracovnej záťaže a zároveň znižovať prevádzkový dopad porúch infraštruktúry.

Rozšírenie v rámci globálnej výpočtovej siete s umelou inteligenciou

Nasadenie WEKA sa rozširuje v rámci globálnej infraštruktúry spoločnosti Andromeda vrátane konfigurácií vyhradených úložísk a systémov Axon s natívnym grafickým procesorom. Spoločnosti tiež plánujú rozšíriť integráciu na novšie generácie infraštruktúry umelej inteligencie, keďže Andromeda pridáva kapacitu a pokrytie poskytovateľov.

Pre poskytovateľov spravovaných grafických procesorov (GPU) toto nasadenie zdôrazňuje rastúcu potrebu prenosnej dátovej platformy s umelou inteligenciou . Samotná kapacita GPU nezaručuje predvídateľný výkon umelej inteligencie, keď sa správanie úložiska a metadát u jednotlivých poskytovateľov líši. Štandardizácia úložnej vrstvy pomáha udržiavať priepustnosť, IOPS a prevádzkové pracovné postupy v rámci distribuovanej flotily heterogénnych klastrov GPU.

Zapojte sa do StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | RSS kanál

Harold Fritts

V technologickom priemysle pôsobím odkedy IBM založila Selectric. Moje skúsenosti sú však v písaní. Preto som sa rozhodol odísť z predpredajného biznisu a vrátiť sa ku svojim koreňom, trochu písať, ale stále sa venovať technológiám.