StorageReview.com

AWS und NVIDIA erweitern Zusammenarbeit bei NVLink Fusion, Blackwell und AI Factories

AI  ◇  Unternehmen

Auf der AWS re:Invent gaben NVIDIA und Amazon Web Services eine erweiterte Partnerschaft bekannt, die sich auf Verbindungstechnologien, Cloud-Infrastruktur, offene Modelle und physikalische KI konzentriert. Diese Zusammenarbeit vertieft die Integration von NVIDIA in die AWS-Plattform und umfasst kundenspezifische Chips, Netzwerktechnik, KI-Software und Robotiksimulation. Im Fokus stehen KI im Produktionsmaßstab und die Anforderungen an eine souveräne Cloud.

NVLink Fusion für AWS Custom Silicon und KI-Infrastruktur der nächsten Generation

Ein zentraler Punkt der Ankündigung ist die Unterstützung von NVIDIA NVLink Fusion durch AWS. AWS wird NVLink Fusion für den Aufbau einer kundenspezifischen KI-Infrastruktur lizenzieren. AWS plant, die NVLink Fusion-Technologie in sein breites Angebot an kundenspezifisch entwickelten Chips zu integrieren. Dazu gehören die Trainium4-Beschleuniger der nächsten Generation für Inferenzaufgaben und das Training agentenbasierter KI-Modelle. Durch die Nutzung von NVIDIA NVLink Fusion verbindet AWS die skalierbare NVIDIA NVLink-Verbindung mit der NVIDIA MGX-Rackarchitektur und seinen kundenspezifischen Chips. Ziel ist es, die Leistung zu steigern, das Systemdesign zu vereinfachen und die Markteinführung von KI-Plattformen der nächsten Generation im Cloud-Maßstab zu beschleunigen.

AWS profitiert zudem vom NVLink Fusion-Lieferanten-Ökosystem, das eine vollständige Rack-Scale-Lösung inklusive Rack, Gehäuse, Stromversorgung und Kühlsubsystemen bietet. Dieses Ökosystem vereinfacht die Beschaffung und Integration für AWS beim Aufbau hochdichter, KI-optimierter Infrastrukturen. Trainium4 ist für die nahtlose Zusammenarbeit mit NVLink und NVIDIA MGX konzipiert. Dies markiert den Beginn einer generationsübergreifenden NVLink Fusion-Kooperation zwischen NVIDIA und AWS. AWS hat bereits NVIDIA MGX-Racks mit NVIDIA-GPUs in großem Umfang implementiert. Die Integration von NVLink Fusion zielt darauf ab, die Bereitstellung und das Systemmanagement auf verschiedenen Plattformen zu standardisieren und zu optimieren und dabei AWS-Chips und NVIDIA-Hardware zu kombinieren.

Darüber hinaus nutzt AWS verschiedene Graviton-CPUs, die ein breites Spektrum an allgemeinen und Cloud-nativen Workloads verarbeiten. Das AWS Nitro System spielt dabei eine zentrale Rolle, indem es Virtualisierung, Sicherheit und Daten-Offloading unterstützt und so die Gesamtleistung und den Schutz der AWS-Services verbessert.

NVIDIA-Gründer und CEO Jensen Huang bezeichnete die Zusammenarbeit als Antwort auf die steigende Nachfrage nach GPU-Computing, die durch leistungsfähigere KI-Modelle und eine breitere Anwendung in Unternehmen angetrieben wird. Er beschrieb die NVLink Fusion-Integration mit AWS Trainium4 als Möglichkeit, NVIDIAs Scale-up-Architektur mit AWS' kundenspezifischen Chips zu vereinen, um beschleunigte Plattformen der nächsten Generation zu schaffen, die die von ihm so genannte industrielle Revolution im Bereich der KI vorantreiben. Huang erklärte, das Ziel sei es, fortschrittliche KI zugänglicher zu machen und die globale Infrastruktur in Richtung umfassender künstlicher Intelligenz weiterzuentwickeln.

AWS-CEO Matt Garman hob die Bedeutung der 15-jährigen Partnerschaft zwischen den beiden Unternehmen hervor und betonte, dass die Zusammenarbeit den Ausbau großflächiger KI-Infrastrukturen vorantreibt. Er erwähnte Kundenergebnisse wie höhere Leistung, bessere Effizienz und verbesserte Skalierbarkeit. Garman hob die Unterstützung von NVIDIA NVLink Fusion für Trainium, Graviton und Nitro hervor, um neue technische Möglichkeiten zu erschließen und Innovationen für AWS-Kunden zu beschleunigen.

NVIDIA Vera Rubin-Architektur auf AWS

Im Netzwerkbereich unterstützt die NVIDIA Vera Rubin-Architektur auf AWS den AWS Elastic Fabric Adapter und das Nitro System. Dieses Design bietet Kunden flexible und robuste Netzwerkoptionen, gewährleistet volle Kompatibilität mit der bestehenden Cloud-Infrastruktur von AWS und beschleunigt die Bereitstellung neuer KI-Dienste.

Konvergenz von Skalierung und Souveränität mit Blackwell und AWS AI Factories

AWS erweitert sein Portfolio für beschleunigtes Rechnen um die NVIDIA Blackwell-Architektur, darunter NVIDIA HGX B300-Systeme und NVIDIA GB300 NVL72-GPUs für große Trainings- und Inferenzcluster. Darüber hinaus werden die NVIDIA RTX PRO 6000 Blackwell Server Edition-GPUs , die für visuelle und grafikintensive Anwendungen entwickelt wurden, voraussichtlich in Kürze auf AWS verfügbar sein.

Diese GPUs bilden das Infrastruktur-Backbone für AWS AI Factories. Dieses neue KI-Cloud-Angebot richtet sich an Kunden, die eine dedizierte KI-Infrastruktur in ihren eigenen Rechenzentren benötigen, die von AWS verwaltet wird. Das Modell stellt eine KI-Infrastruktur in Cloud-Qualität in kundeneigenen Einrichtungen bereit. Dadurch behalten Unternehmen die Kontrolle und Sicherheit über ihre KI-Ressourcen in ihren eigenen Umgebungen.

Der Fokus liegt zudem auf der Datenkontrolle durch die Einhaltung lokaler Anforderungen an den Datenspeicherort. So bleiben sensible Informationen innerhalb festgelegter geografischer Grenzen, regulatorische Standards werden erfüllt und ein reibungsloser Betrieb ermöglicht. Das Modell bietet Zugriff auf fortschrittliche Trainings- und Inferenzplattformen in großem Umfang und ermöglicht Nutzern die effiziente Entwicklung, Bereitstellung und Verwaltung komplexer KI-Lösungen für große Datensätze.

Globales Engagement

NVIDIA und AWS engagieren sich für den weltweiten Einsatz souveräner KI-Clouds und die Bereitstellung fortschrittlicher KI-Funktionen in Regionen, die strenge KI-Richtlinien einhalten müssen. Mit AWS AI Factories planen die beiden Unternehmen eine sichere, souveräne KI-Infrastruktur bereitzustellen, die unübertroffene Rechenkapazität bietet und gleichzeitig den steigenden regulatorischen Anforderungen und dem Datenschutz gerecht wird.

Für Organisationen des öffentlichen Sektors stellt AWS mit AI Factories einen bedeutenden Paradigmenwechsel in der Strategie für Supercomputing und KI im öffentlichen Sektor dar. Kunden können die zuverlässige, sichere und skalierbare Cloud-Infrastruktur von AWS mit NVIDIA Blackwell GPUs und dem kompletten NVIDIA-Stack für beschleunigtes Rechnen, einschließlich NVIDIA Spectrum-X Ethernet-Switches, kombinieren.

Ziel ist die Schaffung eines einheitlichen Systems, das Kunden Zugang zu fortschrittlichen KI-Diensten und -Funktionen ermöglicht und ihnen erlaubt, sehr große Modelle in großem Umfang zu trainieren und einzusetzen. Darüber hinaus gewährleisten Organisationen die strikte Kontrolle über firmeneigene Daten, die den lokalen Vorschriften entsprechen.

NVIDIA Software auf AWS: Vereinfachung der Entwickler- und Datenerfahrung

NVIDIA und AWS arbeiten außerdem gemeinsam an Software- und Datenschichten, um die Verarbeitung unstrukturierter Daten zu beschleunigen und Agentenlebenszyklen zu verwalten.

Amazon OpenSearch Service bietet jetzt serverlose GPU-Beschleunigung für den Aufbau von Vektorindizes. Diese basiert auf NVIDIA cuVS, einer Open-Source-Bibliothek für GPU-beschleunigte Vektorsuche und Clustering. Durch diese Integration werden GPUs zum Standard für Workloads mit vielen Vektordaten und unstrukturierten Daten.

Erste Anwender berichten von deutlichen Verbesserungen ihrer Arbeitsabläufe und heben hervor, dass die Vektorindizierung bis zu zehnmal schneller ist und die Effizienz erheblich steigert. Zudem kostet dieser neue Ansatz nur etwa ein Viertel herkömmlicher Methoden, was zu erheblichen Einsparungen führt. Diese Fortschritte gelten als Durchbruch und bieten Anwendern sowohl Geschwindigkeits- als auch Kostenvorteile.

Diese Leistungs- und Kostenverbesserungen tragen dazu bei, die Suchlatenz zu reduzieren, Schreibvorgänge zu beschleunigen und den Durchsatz für dynamische KI-Muster wie die Retrieval-gestützte Generierung zu erhöhen, bei der eine schnelle Vektorindizierung entscheidend ist. AWS ist der erste große Cloud-Anbieter, der serverlose Vektorindizierung mit NVIDIA-GPUs anbietet.

Um KI-Agenten vom Machbarkeitsnachweis bis zur Produktion zu überführen, benötigen Kunden Leistungsdaten, Optimierungswerkzeuge und skalierbares Management.

NVIDIA und AWS arbeiten gemeinsam an einer umfassenden End-to-End-Lösung durch die Integration mehrerer Schlüsselkomponenten. Ziel dieser Kooperation ist die Vereinfachung der Agentenentwicklung, -verwaltung und -optimierung auf ihren Plattformen.

Im Zentrum dieser Initiative stehen die Strands Agents, die die Erstellung und Verwaltung von Agenten unterstützen. Ergänzend dazu bietet das NVIDIA NeMo Agent Toolkit fortschrittliche Werkzeuge für detailliertes Profiling, Leistungsoptimierung und -tuning und gewährleistet so eine effiziente Bereitstellung. Gleichzeitig stellt Amazon Bedrocks AgentCore eine sichere und skalierbare Infrastruktur für Agenten innerhalb der AWS-Umgebung bereit und ermöglicht so einen zuverlässigen Betrieb über verschiedene Anwendungen hinweg. Zusammen gewährleisten diese Elemente einen reibungslosen Übergang von Prototypen zu produktionsreifen, beobachtbaren und skalierbaren KI-Agenten.

Diese erweiterte Softwarepartnerschaft baut auf bestehenden NVIDIA-Integrationen in AWS auf, darunter NVIDIA NIM-Mikrodienste und Frameworks wie NVIDIA Riva für Sprachverarbeitung und NVIDIA BioNeMo für wissenschaftliche Anwendungen. Diese Funktionen, kombiniert mit der Modellentwicklung und -bereitstellung auf Amazon SageMaker und Amazon Bedrock, beschleunigen die Implementierung von agentenbasierter KI, Sprach-KI und wissenschaftlichen Anwendungen unter Nutzung vertrauter AWS-Dienste.

Beschleunigung von physikalischer KI und Robotik auf AWS

Die Zusammenarbeit erstreckt sich auch auf physikalische KI und Robotik, wo das Training und der Einsatz von Robotermodellen von qualitativ hochwertigen Datensätzen und leistungsstarken Simulationsrahmen abhängen.

Die NVIDIA Cosmos World Foundation Models (WFMs) sind jetzt als NVIDIA NIM Microservices auf Amazon EKS verfügbar. Dies ermöglicht Kunden die Ausführung von Echtzeit-Workloads für Robotersteuerung und -simulation in einer Cloud-nativen, Kubernetes-basierten Umgebung, die Zuverlässigkeit und Flexibilität gewährleistet.

Für Batch- und Offline-Aufgaben, wie beispielsweise die Generierung großer Mengen synthetischer Daten, werden Cosmos WFMs auch als Container auf AWS Batch angeboten. Dies unterstützt Workflows mit hohem Durchsatz zur Generierung vielfältiger Weltzustände und Szenarien in großem Umfang.

Die von Cosmos generierten Weltzustände können genutzt werden, um Roboterverhalten in Open-Source-Simulations- und Lernframeworks wie NVIDIA Isaac Sim und Isaac Lab zu trainieren und zu validieren. Dieser Prozess schafft eine vollständige Pipeline, die verschiedene Entwicklungs- und Testphasen unterstützt. Zunächst erzeugen die von Cosmos generierten Weltzustände strukturierte, vielfältige Umgebungen und bieten so ein breites Spektrum an Evaluierungsszenarien.

Anschließend simulieren Isaac Sim und Isaac Lab Robotersysteme und -richtlinien in diesen Umgebungen. Diese Simulationsphase ermöglicht das gründliche Testen und Optimieren des Roboterverhaltens in einer kontrollierten Umgebung. Abschließend werden die Modelle durch Simulationen validiert, bevor sie auf realen Robotern eingesetzt werden. Dieser Ansatz minimiert Risiken und reduziert die Kosten iterativer Tests, wodurch ein zuverlässigerer und effizienterer Entwicklungszyklus gewährleistet wird.

Verschiedene Robotikunternehmen nutzen bereits die NVIDIA Isaac-Plattform auf AWS im gesamten Entwicklungszyklus ihrer Roboter. Zu dieser Gruppe gehören Agility Robotics, Agile Robots, ANYbotics, Diligent Robotics, Dyna Robotics, Field AI, Haply Robotics, Lightwheel, RIVR und Skild AI. Ihre Anwendungsfälle reichen von der Erfassung, Speicherung und Verarbeitung robotergenerierter Daten bis hin zu Trainings- und Simulationsaufgaben, die für die Skalierung realer Anwendungen erforderlich sind.

Langfristige Zusammenarbeit und Branchenpositionierung

Diese erweiterten Ankündigungen bauen auf der langjährigen Partnerschaft zwischen AWS und NVIDIA auf. Kürzlich wurde NVIDIA mit dem AWS Global GenAI Infrastructure and Data Partner of the Year Award ausgezeichnet. Diese Auszeichnung würdigt Technologiepartner mit der AWS Generative AI Competency und hebt diejenigen hervor, die Vektoreinbettungen, Datenspeicherung und -verwaltung sowie die Generierung synthetischer Daten in verschiedenen Datenformen und -formaten unterstützen.

Durch die erweiterte Zusammenarbeit sind AWS und NVIDIA in der Lage, eng integrierte KI-Plattformen im Cloud-Maßstab bereitzustellen. Diese Plattformen sollen sowohl Leistungs- als auch Souveränitätsanforderungen erfüllen und Unternehmen einen direkteren Weg von experimentellen KI-Projekten zu großflächigen Produktionsimplementierungen ermöglichen.

Beteiligen Sie sich an StorageReview

Newsletter | YouTube | Podcast (iTunes / Spotify) | Instagram | Twitter | TikTok | RSS-Feed

Harold Fritts

Ich bin in der Technologiebranche tätig, seit IBM Selectric gegründet hat. Mein Hintergrund ist jedoch das Schreiben. Also beschloss ich, aus dem Vorverkaufsgeschäft auszusteigen und zu meinen Wurzeln zurückzukehren, ein bisschen zu schreiben, mich aber immer noch mit Technologie zu beschäftigen.