Společnost Pliops oznámila strategické partnerství s vLLM Production Stack , open-source implementací referenčních řešení pro celý klastr, která je navržena pro optimalizaci úloh odvozování velkých jazykových modelů (LLM). Toto partnerství je klíčové v době, kdy se komunita umělé inteligence připravuje na setkání na konferenci GTC 2025. Kombinací pokročilého úložiště klíč-hodnota (KV) od Pliops s robustní architekturou vLLM Production Stack nastavuje tato spolupráce nový standard pro výkon, efektivitu a škálovatelnost umělé inteligence.
Junchen Jiang, vedoucí laboratoře LMCache na Chicagské univerzitě, zdůraznil potenciál spolupráce a zdůraznil její schopnost zvýšit efektivitu a výkon inference LLM. Společné řešení přináší pokročilé funkce vektorového vyhledávání a načítání zavedením nové úrovně paměti v petabajtovém měřítku pod úrovní paměti s vysokou šířkou pásma (HBM). Vypočítané KV mezipaměti jsou efektivně uchovávány a načítány pomocí disagregovaného inteligentního úložiště, což urychluje inferenci vLLM.
Úvod do Pliopsu najdete v našem podrobném článku.
O té KVCache
Většina rozsáhlých jazykových modelů používá transformační architektury, které se spoléhají na mechanismy pozornosti zahrnující matice dotazů, klíčů a hodnot. Při sekvenčním generování tokenů transformátory opakovaně počítají pozornost, což vyžaduje přepočet předchozích matic klíčů a hodnot (KV), což vede ke zvýšeným výpočetním nákladům. Ukládání KV do mezipaměti to řeší uložením dříve vypočítaných KV matic, což umožňuje jejich opětovné použití v následných predikcích tokenů, čímž se výrazně zlepšuje efektivita generování a propustnost.
To však s sebou přináší nové výzvy. Mezipaměti KV se mohou značně zvětšit, zejména během dlouhých generací nebo dávkové inference s typickou velikostí dávek 32, která nakonec překročí dostupnou paměť. Pro řešení tohoto omezení je nezbytné úložiště mezipaměti KV.
Pliops XDP LightningAI
Nasazení systému XDP LightningAI od společnosti Pliops v datových centrech představuje zásadní změnu v nákladové efektivitě a ve srovnání s tradičními architekturami přináší značné úspory nákladů. Přidáním dedikovaných serverů XDP LightningAI vedle stávající infrastruktury mohou organizace dosáhnout pozoruhodných úspor, včetně 67% optimalizace prostoru v racku, 66% snížení spotřeby energie, 58% roční úspory provozních nákladů a 69% snížení počátečních investičních nákladů.
Společnost Pliops pokračuje v rozvoji svého procesoru Extreme Data Processor (XDP) s integrovaným obvodem XDP-PRO ASIC, doplněného komplexním softwarovým balíkem pro umělou inteligenci a distribuovanými uzly. Toto řešení využívá rozhraní Key-Value I/O iniciované GPU a umožňuje bezprecedentní škálovatelnost a výkon. Pliops XDP LightningAI přináší podstatné zlepšení výkonu od začátku do konce a dosahuje až 8násobného zvýšení inference vLLM, čímž výrazně zrychluje úlohy generativní umělé inteligence (GenAI). Díky integraci nejmodernějších trendů v oboru, jako je DeepSeek, zajišťuje Pliops robustní adaptabilitu pro budoucí vývoj umělé inteligence.
Společnost Pliops tyto pokroky představila na konferenci AI DevWorld a zdůraznila, jak XDP LightningAI způsobuje revoluci ve výkonu LLM tím, že výrazně snižuje výpočetní výkon a náklady. Tato demonstrace ilustrovala závazek společnosti Pliops umožňovat udržitelné inovace v oblasti umělé inteligence na úrovni podniků.
Pokračující spolupráce
Pliops umožňuje organizacím maximalizovat potenciál poznatků založených na umělé inteligenci a udržet si konkurenční výhodu v rychle se vyvíjejícím technologickém prostředí tím, že poskytuje okamžitý přístup k použitelným datům a zajišťuje bezproblémovou integraci.
Budoucí plán spolupráce zahrnuje nezbytnou integraci Pliopsova KV-IO stacku do produkčního stacku s postupným rozvojem pokročilých funkcí, jako je rychlé ukládání do mezipaměti napříč vícenásobnými konverzacemi, škálovatelné odlehčení KV-cache a efektivní strategie směrování.




Amazon