MinIO hat MemKV angekündigt, einen Kontextspeicher , der einen zunehmenden Engpass in groß angelegten KI-Inferenzumgebungen beheben soll. Als zweite Kernkomponente im Portfolio des Unternehmens neben AIStor erweitert MemKV die Dateninfrastruktur von MinIO auf die Speicherebene und zielt auf persistenten, gemeinsam genutzten Kontext für agentenbasierte KI-Workloads ab, die auf GPU-Clustern ausgeführt werden.
Da sich KI-Systeme von Interaktionen mit einfacher Reaktion hin zu mehrstufigem Denken und der Ausführung von Aufgaben entwickeln, ist die Aufrechterhaltung des Kontextes über Inferenzzyklen hinweg entscheidend geworden. In aktuellen Architekturen geht Kontext häufig aufgrund begrenzter Kapazität in GPU-nahen Speicherebenen wie HBM und DRAM verloren. Dies zwingt GPUs, zuvor generierten Kontext neu zu berechnen, was Latenz, Rechenauslastung und Energieverbrauch erhöht. MinIO bezeichnet dies als eine Art Neuberechnungsgebühr, die sich bei großem Umfang, insbesondere in Hyperscale- und Cloud-Umgebungen, summiert.
MemKV wurde entwickelt, um dieses Problem durch eine gemeinsam genutzte, persistente Speicherschicht zu beheben, die Zugriffe im Mikrosekundenbereich im Petabyte-Maßstab ermöglicht. Durch die Beibehaltung des Kontextes über verschiedene Inferenzoperationen hinweg reduziert die Plattform redundante Berechnungen und verbessert die Gesamteffizienz des Systems. Interne Benchmarks von MinIO zeigen Verbesserungen der Zeit bis zum ersten Token bei Produktionsumgebungen mit hoher Parallelität. In einer repräsentativen Implementierung mit 128 GPUs und Kontextfenstern von 128 Token stieg die GPU-Auslastung von etwa 50 Prozent auf über 90 Prozent, was zu erheblichen jährlichen Einsparungen bei den Rechenkosten führte.
Die Führungskräfte von MinIO stellten fest, dass der Mehraufwand für die Neuberechnung bei kleineren Implementierungen bisher kaum ins Gewicht fiel, sich aber bei größeren Systemen als strukturelle Ineffizienz erweist. Mit dem Wachstum von GPU-Clustern steigen die Kosten für die wiederholte Kontextneugenerierung sowohl hinsichtlich des Stromverbrauchs als auch der Infrastrukturanforderungen, wodurch speziell entwickelte Speichersysteme für einen nachhaltigen KI-Betrieb unerlässlich werden.
Die Bewältigung des Speicher-Skalierungs-Kompromisses
Die traditionelle KI-Infrastruktur erzwingt einen Kompromiss zwischen Geschwindigkeit und Skalierbarkeit. Hochleistungsspeicher wie HBM und DRAM bieten Latenzzeiten im Mikrosekundenbereich, sind aber kapazitätsbeschränkt und teuer. Speichersysteme hingegen bieten Skalierbarkeit, führen aber zu Latenzzeiten im Millisekundenbereich, was für Echtzeit-Inferenz und kontextbezogenes Schließen ungeeignet ist.
MemKV schließt diese Lücke durch eine gemeinsam genutzte Speicherebene, die latenzarmen Zugriff mit hoher Speicherkapazität kombiniert. Die Plattform, die für NVIDIA BlueField-4 STX entwickelt wurde und mit NVIDIA Dynamo und NIXL integriert ist, ermöglicht es einem gesamten GPU-Cluster, auf einen gemeinsamen Pool von Kontextdaten mit Geschwindigkeiten zuzugreifen, die den Inferenzanforderungen entsprechen. Dieser Ansatz eliminiert die Notwendigkeit, Kontextdaten zwischen verschiedenen Speicher- und Datenspeicherebenen zu übertragen, wodurch die Latenz reduziert und der Durchsatz verbessert wird.
Architektur optimiert für Inferenz-Workloads
MemKV wurde speziell für den Inferenzdatenpfad entwickelt und entspricht der Beschreibung der G3.5-Schicht in der GPU-Speicherhierarchie gemäß MinIO. Es bietet Speicherkapazität im Petabyte-Bereich auf NVMe-basierter Infrastruktur bei gleichzeitiger Beibehaltung von Zugriffszeiten im Mikrosekundenbereich und entkoppelt so effektiv die Speicherkapazität von den GPU-Rechenressourcen.
Das System umgeht herkömmliche Speicherabstraktionen, indem es Daten direkt von NVMe über eine durchgängige RDMA-Übertragung in den KI-Datenpfad überträgt . Dadurch entfällt der Overhead von HTTP-Protokollen, Dateisystemübersetzungen und zwischengeschalteten Speicherservern, die in objekt- und dateibasierten Architekturen üblich sind.

Quelle: Google
Zu den wichtigsten Architekturelementen gehört die native Ausführung auf NVIDIA BlueField-4 STX als ARM64-Binärdatei, die in die Speicherschicht eingebettet ist. Dadurch wird die Abhängigkeit von externen x86-Speicherknoten reduziert. Datenübertragungen erfolgen per RDMA vom GPU-Speicher zu NVMe und umgehen so herkömmliche Speicherarchitekturen. MemKV verwendet zudem größere Blockgrößen von 2 MB bis 16 MB, die für den GPU-Durchsatz optimiert sind, anstatt der herkömmlichen 4-KB-Speicherblöcke. Die Netzwerkleistung ist auf moderne Hochgeschwindigkeits-Fabrics wie NVIDIA Spectrum-X Ethernet und PCIe Gen6 abgestimmt und ermöglicht so nahezu Datenübertragungsgeschwindigkeit im gesamten Cluster.
Verfügbarkeit
MinIO MemKV ist ab sofort verfügbar.




Amazon