AMD hat die Pensando Pollara 400 angekündigt, die branchenweit erste vollprogrammierbare KI-Netzwerkkarte (NIC). Diese innovative Lösung wurde zur Beschleunigung von KI-Workloads entwickelt, ist mit den sich entwickelnden Standards des Ultra Ethernet Consortium (UEC) kompatibel und für die Verbesserung der GPU-zu-GPU-Kommunikation in Rechenzentren optimiert. Die Pollara 400 KI-NIC stellt einen bedeutenden Fortschritt beim Aufbau einer skalierbaren, leistungsstarken Infrastruktur für KI/ML-Workloads, generative KI und große Sprachmodelle dar.
Mit der Weiterentwicklung der KI stehen Unternehmen vor der Herausforderung, ähnliche Recheninfrastrukturen zu entwickeln, die optimale Leistung bieten und gleichzeitig flexibel an zukünftige Anforderungen angepasst werden können. Ein entscheidender Faktor dieser Entwicklung ist die effiziente Skalierung von GPU-Kommunikationsnetzwerken innerhalb der Knoten. AMDs Engagement, Kunden die Wahlfreiheit zu lassen und die Gesamtbetriebskosten (TCO) ohne Leistungseinbußen zu senken, zeigt sich in der Pollara 400 AI NIC. Diese Lösung ermöglicht Unternehmen den Aufbau einer zukunftsfähigen KI-Infrastruktur und gleichzeitig die Kompatibilität mit einem offenen Ökosystem.
Beschleunigung von KI-Workloads durch erweiterte Vernetzung
Die Maximierung der KI-Cluster-Leistung hat für Cloud-Service-Provider, Hyperscaler und Unternehmen höchste Priorität. Viele Organisationen sehen jedoch das Netzwerk als Engpass, der die GPU-Auslastung einschränkt. Obwohl die Datenübertragungsgeschwindigkeit entscheidend ist, ist sie nur dann von Vorteil, wenn das Netzwerk für die Anforderungen moderner KI-Workloads optimiert ist.
| Normen | Details |
|---|---|
| Maximale Bandbreite | 400 Gbps |
| Formfaktor | Halbe Höhe, halbe Länge (HHHL) |
| Host-Schnittstelle | PCIe-Gen5.0 x16 |
| Ethernet-Schnittstelle | QSFP112 (NRZ/PAM4 Serdes) |
| Ethernet-Geschwindigkeiten | 25/50/100/200/400 Gbps |
| Ethernet-Konfigurationen | Unterstützt bis zu 4 Ports: 1 x 400G 2 x 200G 4 x 100G 4 x 50G 4 x 25G |
| Verwaltung | MCTP über SMBus |
Die Pensando Pollara 400 AI NIC bewältigt diese Herausforderungen durch intelligentes Lastenausgleich, Überlastungsmanagement, schnelles Failover und Wiederherstellung nach Systemausfall. Diese Funktionen stellen sicher, dass Netzwerk- und Rechenressourcen voll ausgelastet sind, was zu höherer Verfügbarkeit, schnellerer Auftragsabwicklung und verbesserter Zuverlässigkeit im großen Maßstab führt. Angesichts zunehmender Komplexität und Größe von KI-Workloads bietet die Pollara 400 AI NIC die notwendigen Tools, um Engpässe zu beseitigen und das volle Potenzial der KI-Infrastruktur auszuschöpfen.
Eine zukunftssichere, programmierbare Lösung
Die Pollara 400 AI NIC basiert auf AMDs P4-Architektur und bietet eine vollständig programmierbare Hardware-Pipeline mit unübertroffener Flexibilität. Diese Programmierbarkeit ermöglicht es Kunden, sich an neue Standards, wie beispielsweise die der UEC, anzupassen oder individuelle Transportprotokolle für ihre spezifischen Workloads zu erstellen. Im Gegensatz zu herkömmlicher Hardware, die neue Generationen benötigt, um neue Funktionen zu unterstützen, ermöglicht die Pollara 400 Unternehmen, ihre KI-Infrastruktur zu aktualisieren, ohne auf Hardware-Updates warten zu müssen.
Zu den Hauptmerkmalen des Pollara 400 gehört die Unterstützung mehrerer Transportprotokolle wie RoCEv2, UEC RDMA und anderer Ethernet-Protokolle, wodurch die Kompatibilität mit unterschiedlichen Workloads gewährleistet wird. Erweiterte Funktionen wie intelligentes Packet Spraying, Out-of-Order-Paketverarbeitung und selektive Neuübertragung optimieren die Bandbreitennutzung und reduzieren die Latenz, was für das Training und den Einsatz großer KI-Modelle entscheidend ist. Pfadbewusste Überlastungskontrolle und schnelle Fehlererkennung gewährleisten eine Leistung nahe der Wire-Rate und minimieren die GPU-Leerlaufzeit, selbst bei vorübergehender Überlastung oder Netzwerkausfällen.
Der Vorteil eines offenen Ökosystems
Der offene Ökosystemansatz von AMD gewährleistet herstellerunabhängige Kompatibilität und ermöglicht Unternehmen den Aufbau einer KI-Infrastruktur, die aktuelle Anforderungen erfüllt und gleichzeitig für zukünftige Anforderungen skalierbar und programmierbar ist. Diese Strategie reduziert die Investitionsausgaben (CapEx), da keine teuren, zellenbasierten großen Puffer-Switching-Fabrics mehr erforderlich sind, und gewährleistet gleichzeitig eine hohe Leistung.
Die Pensando Pollara 400 AI NIC wurde bereits in einigen der weltweit größten Scale-Out-Rechenzentren validiert. Cloud-Service-Provider (CSPs) haben sich aufgrund ihrer einzigartigen Kombination aus Programmierbarkeit, hoher Bandbreite, geringer Latenz und umfangreichem Funktionsumfang für diese Lösung entschieden. Durch die Ermöglichung einer erweiterbaren Infrastruktur innerhalb eines offenen Ökosystems unterstützt AMD Unternehmen dabei, ihre KI-Umgebungen zukunftssicher zu gestalten und gleichzeitig sofortige Leistungsvorteile zu erzielen.




Amazon