Společnost PEAK:AIO představila inovativní řešení navržené pro sjednocení akcelerace KVCache s rozšířením paměti GPU a zaměřené na požadavky rozsáhlých úloh s využitím umělé inteligence. Tato nová platforma řeší potřeby inference, agentních systémů a tvorby modelů, jelikož aplikace umělé inteligence se posouvají od statických výzev k dynamickým kontextovým streamům a dlouhodobě běžícím agentům. Posun ve složitosti úloh s využitím umělé inteligence vyžaduje odpovídající vývoj infrastruktury a nejnovější nabídka společnosti PEAK:AIO je navržena tak, aby těmto výzvám čelila.
Eyal Lemberger, spoluzakladatel a hlavní stratég pro umělou inteligenci ve společnosti PEAK:AIO, zdůrazňuje kritickou potřebu zacházet s historií tokenů jako s pamětí, nikoli s tradičním úložištěm. Poukazuje na to, že moderní modely umělé inteligence mohou vyžadovat více než 500 GB paměti na instanci a že škálování paměti musí držet krok s pokrokem ve výpočetní technologii. Lemberger poznamenává, že s tím, jak transformační modely rostou a stávají se složitějšími, již starší přístupy, jako je dodatečná montáž úložných zásobníků nebo nadměrné rozšiřování NVMe, nestačí. Nová 1U platforma pro tokeny od společnosti PEAK:AIO je navržena pro operace zaměřené na paměť, nikoli pro ukládání souborů, což představuje významný odklon od konvenčních architektur.
Architektura zaměřená na tokeny pro škálovatelnou umělou inteligenci
Platforma PEAK:AIO je první, která implementuje architekturu zaměřenou na tokeny, využívající paměť CXL, Gen5 NVMe a GPUDirect RDMA k zajištění trvalé propustnosti až 150 GB/s s latencí pod 5 mikrosekund.
Platforma podporuje opětovné použití KVCache napříč relacemi, modely a uzly, což umožňuje efektivnější využití paměti a rychlejší přepínání kontextů. Umožňuje také rozšiřování kontextových oken, což je zásadní pro udržování delších historií LLM a podporu složitějších interakcí s umělou inteligencí. Odlehčením paměti GPU prostřednictvím skutečného vrstvení CXL řešení zmírňuje saturaci paměti GPU, což je běžné úzké hrdlo ve velkých nasazeních umělé inteligence. Přístup s ultra nízkou latencí je dosažen pomocí RDMA přes NVMe-oF, což zajišťuje dostupnost paměti tokenů s rychlostmi paměťové třídy.
Na rozdíl od tradičních úložných řešení založených na NVMe je architektura PEAK:AIO navržena tak, aby fungovala jako skutečná paměťová infrastruktura. To umožňuje týmům ukládat do mezipaměti historii tokenů, mapy pozornosti a streamovaná data s rychlostí a efektivitou RAM, místo aby s těmito prvky zacházely jako se soubory. Platforma je plně v souladu s modely opětovného použití a uvolnění paměti KVCache od společnosti NVIDIA a poskytuje tak bezproblémovou integraci pro týmy pracující s TensorRT-LLM nebo Triton. Tato kompatibilita s pluginy zrychluje inferenci a snižuje režijní náklady na integraci, což přináší významnou výhodu ve výkonu.
Lemberger zdůrazňuje, že zatímco se jiní dodavatelé snaží přizpůsobit souborové systémy tak, aby se chovaly jako paměť, PEAK:AIO vyvinul infrastrukturu, která ze své podstaty funguje jako paměť. Toto rozlišení je klíčové pro moderní umělou inteligenci, kde je prioritou rychlý přístup ke každému tokenu na úrovni paměti, nejen k ukládání souborů.
Mark Klarzynski, spoluzakladatel a hlavní strategický ředitel společnosti PEAK:AIO, zdůrazňuje použití technologie CXL jako klíčový rozlišovací prvek. Platformu popisuje jako skutečnou paměťovou strukturu pro umělou inteligenci, na rozdíl od konkurence, která na sebe navazuje zařízení NVMe. Klarzynski poznamenává, že tato inovace je nezbytná pro zajištění skutečných paměťových kapacit ve velkém měřítku a podporu nové generace úloh umělé inteligence.
Řešení je plně softwarově definované a běží na standardních serverech, díky čemuž je dostupné a škálovatelné pro různá podniková a cloudová prostředí. PEAK:AIO očekává, že platforma vstoupí do produkčního prostředí do 3. čtvrtletí, což ji prezentuje jako transformační technologii pro technické prodeje, inženýrské týmy a manažery, kteří chtějí zajistit budoucnost své infrastruktury umělé inteligence.




Amazon