L'entraînement et l'inférence de l'IA à grande échelle transforment les réseaux de centres de données. Le trafic est-ouest entre les GPU/XPU a considérablement augmenté, et les systèmes optiques enfichables traditionnels rencontrent des difficultés en termes de consommation d'énergie, de latence et de complexité physique, alors que les clusters s'étendent à des dizaines de milliers d'accélérateurs. La plateforme CPO (Co-Packaged Optics) de troisième génération de Broadcom, Tomahawk 6-Davisson (TH6-Davisson), est désormais disponible. Elle porte la capacité de commutation optique à 102.4 Tbit/s, doublant ainsi la bande passante de n'importe quel commutateur CPO disponible aujourd'hui. Pour les architectes qui construisent des fabrics d'IA de nouvelle génération, cela représente une amélioration significative du débit, de l'efficacité et de la fiabilité des liaisons.
Conçu spécialement pour la mise en réseau de l'IA
Le TH6-Davisson est conçu pour répondre aux exigences des clusters d'IA modernes. Cela implique des flux est-ouest soutenus et à haut débit, une sensibilité aux fluctuations de liaison et la nécessité d'optimiser l'utilisation des accélérateurs. Fonctionnant à 200 Gbit/s par canal, le TH6-Davisson double le débit par voie et la bande passante totale par rapport à la génération TH5-Bailly précédente. Il offre une interopérabilité transparente entre les émetteurs-récepteurs DR et les interconnexions NPO (Near-Packaged Optics) et CPO à 200 Gbit/s par canal. Il en résulte une évolutivité aisée sur les cartes réseau, les XPU et les commutateurs fabric haut de gamme actuels.
Du point de vue du déploiement, cela signifie :
- Utilisation plus efficace des FLOP en réduisant les blocages induits par les liens et les interruptions de travail.
- Latence de bout en bout inférieure par rapport aux connecteurs traditionnels en raccourcissant les chemins électriques et en minimisant le conditionnement.
- Une enveloppe mécanique et thermique plus propre au niveau du commutateur, facilitant l'intégration du système à l'échelle du rack et de la rangée.
Optiques co-packagées : avantages en termes de puissance et de stabilité
Les optiques enfichables entraînent des pénalités de consommation et introduisent davantage de points de variabilité à mesure que les débits augmentent. Le TH6-Davisson intègre les moteurs optiques directement dans un boîtier partagé avec le commutateur Ethernet, combinant la technologie COUPE (Compact Universal Photonic Engine) de TSMC à un boîtier multipuce avancé au niveau du substrat. Cette intégration hétérogène réduit le besoin de conditionnement du signal, minimisant ainsi les pertes de trace et les réflexions.
Selon Broadcom, les avantages comprennent :
- Réduction d'environ 70 % de la consommation d'énergie des interconnexions optiques par rapport aux connecteurs traditionnels. Ce résultat est plus de 3.5 fois inférieur, ce qui se traduit par des gains significatifs en termes de coût total de possession et de durabilité pour les centres de données hyperscale et IA.
- Amélioration de la stabilité de la liaison grâce à l'élimination des variations de fabrication et de test typiques des émetteurs-récepteurs enfichables. Une précédente étude de fluctuation de la liaison TH5-Bailly est citée comme preuve ; l'intégration plus étroite du TH6 réduit encore davantage les fluctuations, ce qui est essentiel pour les entraînements d'IA de longue durée.
Near Margalit, vice-président et directeur général de la division Systèmes optiques de Broadcom, présente le TH6-Davisson comme un catalyseur pour des clusters d'IA plus grands et plus fiables. Il souligne les gains en termes de stabilité des liaisons et d'efficacité énergétique qui favorisent une meilleure utilisation des accélérateurs, réduisent les interruptions de travail et améliorent la fiabilité globale. Ce sont des leviers clés pour un apprentissage plus rapide et plus efficace des modèles.
Interopérabilité et alignement des normes
Le TH6-Davisson est conçu pour s'intégrer dans des environnements hétérogènes, offrant :
- 200 Gbps par liaison avec conformité IEEE 802.3 pour l'interopérabilité 400G/800G.
- Compatibilité avec les optiques basées sur DR, ainsi que les écosystèmes NPO/CPO à 200 Gbps par canal.
- Modules laser ELSFP remplaçables sur le terrain pour simplifier la maintenance sans renoncer aux avantages d'intégration du CPO.
Cette approche axée sur les normes est essentielle pour les équipes d’approvisionnement et d’ingénierie réseau qui doivent intégrer de nouveaux déploiements avec des équipements 400G et 800G existants tout en planifiant les chemins de mise à niveau.
Points forts du produit : TH6-Davisson BCM78919
- Capacité de commutation de 102.4 Tb/s
- 16 moteurs optiques Davisson DR de 6.4 Tb/s
- Bande passante de liaison de 200 Gbps par canal
- Modules laser ELSFP remplaçables sur le terrain
- Évolutivité jusqu'à 512 XPU par cluster et jusqu'à plus de 100 000 XPU dans des structures à deux niveaux à 200 Gbit/s par lien
- Conforme à la norme IEEE 802.3 ; interopérable avec les normes 400G/800G actuelles
Ces spécifications se traduisent par des fabrics plus denses avec moins d'appareils par unité de bande passante, de meilleurs profils de puissance et une fiabilité d'exécution des tâches plus élevée. Ces points se répercutent directement sur les modèles de retour sur investissement/coût total de possession (TCO) pour les déploiements d'IA.
400 Gbps par canal sur le pont
Broadcom indique que sa plateforme CPO de quatrième génération est en cours de développement, visant une bande passante de 400 Gbit/s par canal avec des gains d'efficacité énergétique supplémentaires. Si elle se concrétise, cette trajectoire permettrait de doubler la cadence tout en continuant à réduire la consommation en watts/bit, un facteur crucial pour les contraintes énergétiques des centres de données à grande échelle.
Disponibilité
Broadcom propose actuellement des échantillons du TH6-Davisson BCM78919 aux clients et partenaires en accès anticipé, avec une disponibilité générale à suivre.
Les optiques co-packagées continuent de s'imposer comme l'outil idéal pour les réseaux à l'ère de l'IA. Elles compressent le chemin électrique, réduisent la consommation et stabilisent les liaisons au moment précis où les clusters atteignent des accélérateurs à six chiffres. La capacité de 102.4 Tbit/s et la réduction de puissance optique annoncée par le TH6-Davisson placent la barre très haut.




Amazon