Koncem července společnost Liqid představila škálovatelnou platformu umělé inteligence postavenou na grafických procesorech AMD Instinct MI350P PCIe. UltraStack 30 kombinuje technologii sdružování komponovatelných grafických procesorů od společnosti Liqid s akcelerátory AMD, aby řešila podniková a cloudová nasazení inference umělé inteligence, která potřebují škálovat nad rámec počtu akcelerátorů a paměťové kapacity konvenčních serverů.
UltraStack 30: Sdružování 30 grafických procesorů AMD MI350P
Navrhovaná architektura umožňuje sdružování až 30 grafických procesorů AMD Instinct MI350P v rámci jednoho serverového prostředí. Liqid uvádí, že to může poskytnout celkovou kapacitu HBM3E o celkové hodnotě 4.3 TB pro rozsáhlé modely, nasazení s rozšířeným načítáním a úlohy inference s dlouhým kontextem. Platforma má umožnit dynamickou alokaci zdrojů grafických procesorů, nikoli jejich fixaci na jednotlivé servery, s nativní podporou Kubernetes pro paralelní nasazení modelů.
Spolupráce se zaměřuje na rostoucí infrastrukturní výzvu v oblasti inference umělé inteligence: maximalizaci užitečného využití akcelerátoru a zároveň kontrolu nákladů na generované tokeny. Společnost Liqid tvrdí, že její přístup se sdruženými GPU dokáže přinést až 3.7x vyšší propustnost tokenů, 2.1x více tokenů na dolar a 1.8x lepší tokeny na watt ve srovnání s tradičními konfiguracemi serverů. Společnost se také zaměřuje na až 65% snížení nákladů na nasazení a 50% snížení spotřeby energie u rozsáhlých nasazení. Údaje podle ní vycházejí z interních projekcí, které se liší v závislosti na konfiguraci a pracovní zátěži.
„Společnost Liqid se etablovala jako lídr v oblasti sdružování a škálování GPU. Řada AMD Instinct MI350P nám poskytuje ideální GPU založenou na PCIe pro budování infrastruktury umělé inteligence nové generace, což nám umožňuje dodávat řešení vyladěná pro podnikové inference umělé inteligence, kde využití a cena za token rozhodují o ekonomice,“ řekl Rick Hegberg, generální ředitel společnosti Liqid.
| Liqid UltraStack 30: AMD MI350P | |
| Specifikace | Konfigurace |
| Server | Procesor AMD EPYC™ řady 9005, dvoupaticový |
| GPU | 30× AMD Instinct™ MI350P PCIe |
| Výkon AI | 69 PFLOPS (FP8) |
| Paměť GPU HBM | 4.3 TB |
| Celkový výkon systému | ~22 kW |
| Klíčová metrika | Hodnota |
| Výkon na kW | ~3.14 PFLOPS/kW |
| HBM na kW | ~195 GB/kW |
| HBM na PFLOP | ~62 GB/PFLOP |
Uvnitř MI350P
Společnost AMD prezentuje MI350P jako akcelerátor založený na PCIe, který je navržen tak, aby poskytoval výkon inferenčních technologií pro umělou inteligenci bez nutnosti specializovaného chlazení nebo rozsáhlejšího přepracování datového centra. Specifikace AMD uvádějí kartu se 144 GB paměti HBM3E s propustností paměti 4 TB/s, 2.3 PFLOPS hustého výpočetního výkonu FP8 z architektury CDNA 4 a typickým výkonem desky 600 W (konfigurovatelných 450 W) v pasivně chlazeném dvouslotovém provedení PCIe 5.0. Třicet z těchto karet je přesně to, odkud pocházejí celkové údaje o 4.3 TB a 69 PFLOPS pro UltraStack. V kombinaci s technologii Liqid lze grafické karty přidávat a škálovat dle potřeby, aby se podpořila měnící se poptávka po inferenčních technologiích, což by potenciálně snížilo kapacitu nevyužitých grafických karet a umožnilo vyšší hustotu modelů na systém.
„GPU AMD Instinct MI350P PCIe poskytuje výjimečný výkon pro inferenci umělé inteligence bez nutnosti specializované infrastruktury. Spolu s řešeními pro sdružování GPU od společnosti Liqid mohou zákazníci škálovat zdroje GPU dle potřeby a dosáhnout tak vyššího využití, nižších nákladů na infrastrukturu a špičkové ekonomiky inference umělé inteligence,“ uvedl Suresh Andani, viceprezident pro skupinu výpočetní techniky a podnikové umělé inteligence ve společnosti AMD.
Na koho je platforma zaměřena
Řešení je zaměřeno na podnikové týmy umělé inteligence, poskytovatele NeoCloudových služeb, poskytovatele služeb umělé inteligence a HPC a výzkumné organizace. Mezi identifikované případy použití patří soukromí, lokální podnikoví asistenti pro funkce, jako je prodej, lidské zdroje, marketing, právní oddělení a kódování; RAG a dlouhodobá inference; vědecké úlohy včetně objevování léčiv a materiálové vědy; a smíšené modelové flotily, které obsluhují modely různých velikostí ze sdíleného akceleračního poolu.
Od sdružování GPU k sdružování paměti CXL
CXL stránka tohoto příběhu už není jen teoretická. Začátkem srpna společnost Liqid uvedla na trh paměťovou platformu EX-5410C, kterou společnost označuje za první a jediné plně deagregované, softwarově definované řešení sdružování paměti v oboru. Platforma EX-5410C , postavená na CXL 2.0 a spravovaná pomocí softwaru Liqid Matrix, sdružuje až 40 TB DRAM na šasi, škálovatelná do unifikovaného poolu přesahujícího 160 TB a dynamicky alokuje paměť až na 16 serverových uzlů s tím, co Liqid popisuje jako nulovou kapacitu.
Společnost Liqid uvádí až 30krát rychlejší zpracování úloh grafové analýzy a až 7krát více tokenů za sekundu pro určité úlohy mezipaměti KV na platformě. V Pacifické severozápadní národní laboratoři (Pacific Northwest National Laboratory) již běží první testovací platforma, která je k dispozici výzkumníkům financovaným ministerstvem energetiky (DOE) prostřednictvím iniciativy AMAIS. V případě UltraStacku je zjištění směrové: stejný model kompozice, který Liqid aplikuje na kapacitu GPU, se rozšiřuje i na systémovou paměť, což by v budoucnu umožnilo alokovat sdílenou paměť pro mezipaměť KV a další paměťově náročné úlohy umělé inteligence spolu se sdruženými akcelerátory.
Další podrobnosti o společných řešeních Liqid a AMD se očekávají s postupem společností ve vývoji a nasazení u zákazníků.




Amazon