Společnost MinIO oznámila MemKV, úložiště kontextové paměti , které je navrženo tak, aby řešilo rostoucí úzké hrdlo ve velkých inferenčních prostředích s využitím umělé inteligence. MemKV, který je druhou klíčovou součástí portfolia společnosti vedle AIStor , rozšiřuje datovou infrastrukturu MinIO do paměťové vrstvy a zaměřuje se na perzistentní, sdílený kontext pro agentní úlohy umělé inteligence provozované napříč clustery GPU.
S tím, jak se systémy umělé inteligence vyvíjejí od interakcí založených na jediné odpovědi k vícekrokovému uvažování a provádění úloh, se udržování kontextu napříč inferenčními cykly stalo klíčovým. V současných architekturách se kontext často ztrácí kvůli omezené kapacitě paměťových vrstev sousedících s GPU, jako jsou HBM a DRAM. To nutí GPU přepočítávat dříve vygenerovaný kontext, což zvyšuje latenci, využití výpočetních prostředků a spotřebu energie. MinIO to charakterizuje jako daň z přepočítávání, která se ve velkém měřítku hromadí, zejména v hyperscale a cloudových prostředích.
MemKV je navržen tak, aby tento problém zmírnil tím, že poskytuje sdílenou, perzistentní paměťovou vrstvu schopnou načítání v řádu mikrosekund v petabajtovém měřítku. Udržováním kontextu napříč inferenčními operacemi platforma snižuje redundantní výpočetní výkon a zlepšuje celkovou efektivitu systému. V interních benchmarkech MinIO hlásí zlepšení doby do prvního tokenu na produkčních úrovních souběžnosti. V reprezentativním nasazení se 128 GPU a kontextovými okny o velikosti 128 tisíc tokenů se využití GPU zvýšilo z přibližně 50 procent na více než 90 procent, což vedlo k významným ročním úsporám nákladů na výpočetní výkon.
Vedení MinIO poznamenalo, že režie přepočítávání byla historicky v menších nasazeních maskována, ale ve velkém měřítku se stává strukturální neefektivitou. S růstem clusterů GPU rostou náklady na opakovanou regeneraci kontextu, a to jak z hlediska spotřeby energie, tak i požadavků na infrastrukturu, což činí pro udržitelný provoz umělé inteligence nezbytné specializované paměťové systémy.
Řešení kompromisu mezi velikostí paměti a rozsahem
Tradiční infrastruktura umělé inteligence nutí ke kompromisu mezi rychlostí a škálovatelností. Vysoce výkonné paměťové vrstvy, jako jsou HBM a DRAM, poskytují mikrosekundovou latenci, ale jsou omezené kapacitou a drahé. Naopak úložné systémy nabízejí škálovatelnost, ale zavádějí milisekundovou latenci, která není vhodná pro inferenci v reálném čase a dlouhodobé uvažování.
MemKV je navržen tak, aby tuto mezeru překlenul zavedením vrstvy sdílené paměti, která kombinuje přístup s nízkou latencí a velkou kapacitou. Platforma, postavená pro provoz na NVIDIA BlueField-4 STX a integrovaná s NVIDIA Dynamo a NIXL, umožňuje celému clusteru GPU přístup ke společnému fondu kontextových dat rychlostí odpovídající inferenčním požadavkům. Tento přístup eliminuje potřebu přesouvat kontext mezi různými paměťovými a úložnými vrstvami, čímž snižuje latenci a zlepšuje propustnost.
Architektura optimalizovaná pro inferenční úlohy
MemKV je vytvořen speciálně pro cestu inferenčních dat a je v souladu s popisem vrstvy G3.5 v hierarchii paměti GPU ze strany MinIO. Poskytuje kapacitu v petabajtovém měřítku na infrastruktuře založené na NVMe a zároveň zachovává charakteristiky přístupu na úrovni mikrosekund, čímž efektivně odděluje škálování paměti od výpočetních zdrojů GPU.
Systém se vyhýbá tradičním abstrakcím úložiště tím, že přesouvá data přímo z NVMe do datové cesty AI prostřednictvím end-to-end RDMA transportu . Tím se eliminují režijní náklady spojené s HTTP protokoly, překladem souborových systémů a zprostředkujícími úložnými servery, které jsou běžné v architekturách založených na objektech a souborech.

Zdroj: Google
Mezi klíčové architektonické prvky patří nativní spuštění na NVIDIA BlueField-4 STX jako binární soubor ARM64 vložený do úložné vrstvy, což snižuje závislost na externích úložných uzlech x86. Přenos dat probíhá přes RDMA z paměti GPU do NVMe, čímž se obcházejí konvenční úložné zásobníky. MemKV také používá větší velikosti bloků, od 2 MB do 16 MB, optimalizované pro vzorce propustnosti GPU, namísto starších 4KB úložných bloků. Síťový výkon je v souladu s moderními vysokorychlostními fabricami, včetně NVIDIA Spectrum-X Ethernet a PCIe Gen6, což umožňuje pohyb dat v rámci clusteru téměř rychlostí kabelu.
dostupnost
MinIO MemKV je k dispozici ihned.




Amazon