StorageReview.com

NVIDIA NVHBM intègre le contrôleur de mémoire à la pile HBM, avec Trainium4 d'Amazon en première ligne.

AI  ◇  Entreprise

Les hyperscalers et les opérateurs d'infrastructures spécialisés en IA développent de plus en plus d'accélérateurs d'IA et d'XPU propriétaires pour gérer les grands modèles de langage et les charges de travail de raisonnement complexes. Afin de relever les défis physiques, de mémoire et de réseau liés au déploiement à grande échelle de puces propriétaires, NVIDIA a détaillé son interconnexion NVLink Fusion et son architecture de mémoire personnalisée NVHBM . Cette solution unifiée est conçue pour assurer la compatibilité des puces personnalisées avec les plateformes réseau évolutives et les racks MGX existants de NVIDIA.

Le premier à adopter cette technologie est Annapurna Labs d'Amazon, dont les projets NVHBM ont été dévoilés en même temps que l' extension du partenariat AWS à 2 millions de GPU . Cette annonce présente l'architecture sous-jacente à ce partenariat et désigne Trainium4 comme la première génération Trainium compatible avec NVLink Fusion. NVIDIA met également en place une implémentation NVHBM standard disponible auprès de plusieurs fournisseurs de mémoire, ce qui, selon l'entreprise, simplifie l'intégration et la qualification de la mémoire entre les différents fournisseurs. « NVHBM représente une nouvelle approche architecturale pour améliorer les performances et l'efficacité de la mémoire à large bande passante », a déclaré Nafea Bshara, vice-président d'Annapurna Labs chez Amazon. « Nous sommes impatients de voir cette collaboration technologique profiter aux futures architectures d'infrastructure AWS. »

Schéma NVIDIA comparant un XPU personnalisé avec NVHBM, montrant une interface mémoire plus étroite et une surface de calcul plus grande, au même XPU avec HBM standard.

Le déploiement d'unités de traitement de calcul (XPU) personnalisées dans des centres de données haute densité exige un équilibre entre la logique de calcul, la distribution d'énergie, la dissipation thermique et la mémoire à large bande passante. L'intégration et la qualification de mémoires de pointe engendrent souvent d'importants goulots d'étranglement au niveau du packaging et du développement. Grâce à NVLink Fusion et NVHBM, les concepteurs peuvent exploiter des puces de base et des blocs IP d'interface pré-validés, ce qui réduit la complexité d'intégration et accélère la mise sur le marché.

Optimisation de la bande passante et de la latence de la mémoire

Les charges de travail modernes d'IA, notamment l'inférence de modèles complexes et les pipelines d'agents, exigent un débit mémoire élevé pour la lecture des poids, des activations et des entrées du cache clé-valeur (KV) des modèles. NVHBM propose une puce de base personnalisée, développée en collaboration avec les fabricants de mémoire, offrant une bande passante mémoire par pile jusqu'à 30 % supérieure à celle de la spécification standard JEDEC HBM4E.

Fonctionnalité Avantages NVHBM
Bande passante Jusqu'à 30 % de bande passante mémoire supplémentaire par rapport à la mémoire HBM4e standard.
Région Des interfaces plus efficaces permettent d'augmenter jusqu'à 25 % la surface de la puce de calcul pour des fonctionnalités XPU supplémentaires.
Tuning Moteur Une consommation d'énergie HBM jusqu'à 15 % inférieure à celle de la HBM4e standard se traduit par des économies pour des milliers d'unités XPU.

Tableau 1. La technologie NVHBM apporte trois principaux avantages au niveau de la plateforme aux programmes d'accélération de l'IA : une bande passante mémoire plus élevée, une surface de boîtier et de silicium plus importante et une consommation d'énergie HBM réduite.

Cette augmentation de la bande passante minimise la saturation du moteur de calcul lors des phases d'exécution gourmandes en mémoire. En accélérant les transferts de données entre les piles HBM et la logique de calcul embarquée, les accélérateurs peuvent maintenir une utilisation plus élevée et améliorer les taux de génération de jetons par utilisateur lors de charges de travail d'inférence denses.

Réallocation de la surface de la puce et optimisation de la couche physique

L'espace disponible sur les puces des accélérateurs modernes est strictement limité, ce qui oblige les concepteurs à optimiser l'espace entre les unités arithmétiques et logiques de calcul, les moteurs matriciels, la mémoire SRAM intégrée et les interfaces périphériques. Les architectures HBM standard nécessitent des interfaces physiques larges qui occupent une surface importante.

Rendu NVIDIA d'un package XPU personnalisé avec des piles de mémoire NVHBM encadrant les puces de calcul

La technologie NVHBM résout ce problème en intégrant directement le contrôleur mémoire dans la pile HBM 3D et en utilisant une couche physique (PHY) personnalisée. Cette approche permet de réduire jusqu'à 67 % la surface occupée par la couche physique et les périphériques par rapport aux implémentations HBM4E standard, tout en simplifiant le routage des pistes de l'interposeur et en récupérant jusqu'à 80 % de silicium utilisable supplémentaire. L'interface mémoire plus étroite libère de l'espace dans le boîtier, permettant aux concepteurs d'étendre la puce de calcul IA centrale jusqu'à 30 % afin d'ajouter davantage de cœurs matriciels, d'unités vectorielles ou de hiérarchie de cache, le tout dans un format physique fixe.

Efficacité énergétique et marge de manœuvre à l'échelle de l'installation

La distribution de l'énergie reste l'une des contraintes les plus importantes dans l'exploitation des centres de données hyperscale, influant directement sur la conception thermique et les exigences de refroidissement des accélérateurs. La technologie NVHBM réduit la consommation d'énergie de la mémoire HBM de 15 % par rapport à la mémoire HBM4E standard.

Au niveau du silicium, la réduction de la consommation d'énergie de la mémoire diminue la pression thermique, offrant ainsi une marge de manœuvre électrique supplémentaire pour faire fonctionner les cœurs de calcul à des fréquences soutenues plus élevées. À l'échelle d'un centre de données, ces économies d'énergie sont considérables. Dans un centre de données théorique de 1 gigawatt utilisant des unités de calcul XPU de 2 000 watts, la réduction de la consommation d'énergie de la mémoire peut libérer suffisamment de capacité thermique et électrique pour prendre en charge jusqu'à 15 000 unités XPU supplémentaires.

Intégration à l'échelle du rack via NVLink Fusion

Tandis que NVHBM optimise les performances au niveau de chaque composant, NVLink Fusion assure la liaison au niveau système. Grâce à des chiplets NVLink Fusion dédiés, les XPU personnalisés peuvent se connecter directement à l' architecture NVLink de sixième génération , unifiant ainsi tous les accélérateurs d'un rack en un seul domaine de mémoire et de calcul cohérent.

Cette architecture évolutive est essentielle pour les schémas de parallélisation avancés tels que le parallélisme expert (EP) et WideEP, dans lesquels les modèles distribués de mélange d'experts nécessitent une synchronisation à faible latence des activations et des états cachés sur plusieurs dispositifs physiques. Des processeurs personnalisés peuvent également se connecter aux processeurs hôtes via NVLink-C2C.

En intégrant des puces semi-personnalisées dans l'écosystème matériel et logiciel NVIDIA plus vaste, NVLink Fusion permet aux opérateurs de déployer des environnements hétérogènes qui combinent des XPU personnalisées avec des GPU NVIDIA standard sous une architecture de rack MGX standardisée, simplifiant ainsi les opérations et la gestion des charges de travail.

S'engager avec StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Flux RSS

Harold Fritt

Je suis dans l'industrie de la technologie depuis qu'IBM a créé Selectric. Ma formation, cependant, est l'écriture. J'ai donc décidé de sortir de l'avant-vente et de revenir à mes racines, en écrivant un peu mais en restant impliqué dans la technologie.