WEKA gab bekannt, dass Andromeda, die Plattform, die KI-Teams mit Hochleistungsrechnern verschiedener Anbieter verbindet, WEKA NeuralMesh als zentrale Datenspeicherschicht für ihre verwalteten GPU-Cluster integriert. Andromeda-Kunden können zwischen einer dedizierten NeuralMesh-Bereitstellung und einer GPU-nativen NeuralMesh-Axon-Konfiguration wählen und erhalten so eine konsistente Speicherleistung auf jedem Cluster, der bei einem beliebigen Hyperscaler oder in einer KI-Cloud betrieben wird.
Andromeda arbeitet mit über 50 Rechenanbietern weltweit zusammen und leitet Trainings- und Inferenz-Workloads über eine wachsende Flotte verwalteter Cluster. Das Unternehmen betreut nach eigenen Angaben mehr als 100 KI-Kunden und unterstützt Milliarden von GPU-Stunden. Jeder Cluster auf der Plattform muss dieselben Qualitätsstandards erfüllen, unabhängig vom Betreiber der Infrastruktur. Andromeda zertifiziert jeden Cluster hinsichtlich GPU, Speicher, Netzwerk und Sicherheit, bevor er an einen Kunden ausgeliefert wird. Dieser Standard legte das Problem offen: Jeder Anbieter brachte seine eigene Speicherumgebung mit, und die Leistung variierte von Cluster zu Cluster.
NeuralMesh zielt darauf ab, diese Datenschicht zu standardisieren. Für Andromeda bietet die Plattform eine einsetzbare Speicherarchitektur, die hardwareübergreifend einheitlich konfiguriert wird, anstatt sich auf die jeweilige native Shared-Storage-Implementierung der Cloud oder des Rechenzentrums zu verlassen.
„Unser Ziel ist es, den globalen Fluss von Rechenleistung zu ermöglichen. Das bedeutet, dass jeder von uns bereitgestellte Cluster unabhängig von seiner Herkunft Leistung erbringen muss“, so Wil Moushey, CEO von Andromeda. „Die Standardisierung auf WEKA NeuralMesh bietet unseren Kunden Konsistenz auf Hyperscaler-Niveau mit der Flexibilität eines offenen Marktes auf der Speicher- und Arbeitsspeicherebene – genau dort, wo Leistung entscheidend ist. Ungenutzte GPUs bremsen die KI-Innovation. WEKA hilft uns sicherzustellen, dass jede von uns verwaltete GPU ihre Leistung erwirtschaftet.“
GPU-nativer Speicher mit NeuralMesh Axon
NeuralMesh Axon ist die GPU-native Implementierung der NeuralMesh-Softwareplattform. Sie integriert den Speicher direkt in die GPU-Server von Andromeda und wandelt so die vorhandenen NVMe-Speicher der Cluster in eine einheitliche Datenschicht um, die Training und Inferenz speist. Daraus ergibt sich ein wirtschaftlicher Vorteil: Die Hardware ist bereits installiert, mit Strom versorgt und bezahlt, sodass die Leistung ohne zusätzlichen Platzbedarf, Stromverbrauch oder Kosten bereitgestellt wird. WEKA nennt ein Beispiel, in dem ein Forschungslabor feststellte, dass die Speicherkapazität seines Clusters die Workloads ausbremste. Andromeda implementierte Axon daraufhin auf derselben Hardware, anstatt zusätzliche Infrastruktur zu schaffen.
Andromeda nutzt den NeuralMesh Kubernetes Operator zur Automatisierung der Clusterbereitstellung und des Lebenszyklusmanagements. Das Unternehmen gibt an, dass neue NeuralMesh Axon-Cluster innerhalb von etwa 10 Minuten direkt auf der Hardware bereitgestellt werden können. Rund die Hälfte der NeuralMesh-Bereitstellungen verwendet die Axon-Konfiguration, während die übrigen dedizierte Bereitstellungen für Kunden sind, die exklusive GPU-Rechen- und Speicherressourcen benötigen.
„Andromedas erste WEKA NeuralMesh Axon-Implementierung war in nur 10 Minuten einsatzbereit – direkt auf der Hardware. Das wurde zu unserem Vorbild“, so Vishvajit Kher, leitender Architekt bei Andromeda. „Wenn ein Cloud-Anbieter keinen gemeinsam genutzten Speicher anbietet, sind wir nicht mehr aufgeschmissen. Wir setzen WEKA NeuralMesh ein und wissen, dass es funktioniert. Es ist ein vollwertiges System, bis zu 90 % günstiger als vergleichbare Produkte auf dem Markt und bietet Einsparungen, die sich mit zunehmender Größe des Systems vervielfachen.“
Das Bereitstellungsmodell ermöglicht es Andromeda, verwaltete GPU-Cluster in Umgebungen einzurichten, in denen Cloud-Anbieter keinen gemeinsam genutzten Speicher anbieten. Dadurch erweitert sich das Spektrum der Anbieterinfrastruktur, die die betrieblichen Anforderungen erfüllt.
Gemeldete Produktionsergebnisse
Andromeda berichtet, dass NeuralMesh Axon-Cluster einen Gesamtdurchsatz von über 400 GB/s pro Cluster erreichen und in Produktionsumgebungen mehr als 6 Millionen IOPS erzielen. In einem Biotech-Workload mit metadatenintensiven Datensätzen und etwa einer Milliarde Dateien pro Verzeichnis reduzierte die Plattform die Datenübertragungszeit von Stunden auf Minuten.
Das Unternehmen berichtet außerdem, dass KI-Teams, die seine verwalteten Cluster nutzen, die Startzeiten ihrer Umgebung von etwa drei Minuten auf 30 Sekunden reduzieren konnten. Durch die schnellere Initialisierung der Umgebung können Teams mehr Trainings-, Test- und Inferenziterationen während eines Entwicklungszyklus durchführen.
NeuralMesh verfügt über Funktionen zur Fehlerisolierung, um zu verhindern, dass sich lokale Ausfälle auf einen gesamten Cluster ausweiten. Für Anbieter, die Multi-Tenant-GPU-Umgebungen betreiben, trägt dies dazu bei, die Verfügbarkeit von Workloads aufrechtzuerhalten und gleichzeitig die betrieblichen Auswirkungen von Infrastrukturfehlern zu reduzieren.
Erweiterung über ein globales KI-Rechennetzwerk
Die WEKA-Implementierung wird in der globalen Infrastruktur von Andromeda ausgeweitet, einschließlich dedizierter Speicherkonfigurationen und GPU-nativer Axon-Systeme. Die Unternehmen planen außerdem, die Integration auf neuere Generationen von KI-Infrastruktur auszudehnen, sobald Andromeda die Kapazität und die Anbieterabdeckung erweitert.
Für Anbieter von Managed GPUs verdeutlicht diese Implementierung den wachsenden Bedarf an einer portablen KI-Datenplattform . GPU-Kapazität allein garantiert keine vorhersehbare KI-Performance, wenn sich Speicher- und Metadatenverhalten je nach Anbieter unterscheidet. Die Standardisierung der Speicherschicht trägt dazu bei, Durchsatz, IOPS und Betriebsabläufe in einer verteilten Flotte heterogener GPU-Cluster aufrechtzuerhalten.





Amazon