StorageReview.com

NVIDIA offre un aperçu des prochaines étapes pour les usines d'IA à l'échelle du gigawatt lors du sommet mondial de l'OCP

AI  ◇  Entreprise

NVIDIA a annoncé les spécifications de ses serveurs rack à architecture ouverte Vera Rubin NVL144 de génération MGX. Plus de 50 partenaires MGX préparent cette sortie, ainsi que la prise en charge par l'écosystème de NVIDIA Kyber, qui relie 576 GPU Rubin Ultra et est conçu pour répondre aux exigences croissantes en matière d'inférence.

En septembre, NVIDIA a annoncé un partenariat élargi avec Intel . Parallèlement, Intel a présenté ses nouveaux processeurs Xeon 6, dont l'un sert de processeur principal pour la carte NVIDIA DGX B300, la dernière génération de systèmes d'IA accélérée de la marque. La NVIDIA DGX B300 intègre le processeur Intel Xeon 6776P, qui joue un rôle essentiel dans la gestion, l'orchestration et le support du système d'IA accélérée. Grâce à sa capacité mémoire et sa bande passante élevées, le Xeon 6776P répond aux besoins croissants des modèles et des ensembles de données d'IA.

Le Xeon 6776P est conçu comme un processeur « hôte GPU » avec les technologies Priority Core Turbo (PCT) et Intel Speed ​​Select-Turbo Frequency (SST-TF). Ainsi, un petit nombre de cœurs peut accélérer et gérer l'orchestration sensible à la latence, tandis que d'autres cœurs fonctionnent à leur fréquence de base. Cela contribue à optimiser l'utilisation du GPU dans les clusters NVLink en réduisant les blocages lors du prétraitement, de la gestion du cache KV et de la planification.

Vera Rubin NVL144 : conçu pour s'adapter aux usines d'IA

Le plateau de calcul Vera Rubin NVL144 MGX présente une conception modulaire écoénergétique, entièrement refroidie par liquide. Son fond de panier central, composé d'un circuit imprimé, remplace les connexions câblées traditionnelles, permettant un assemblage plus rapide et une maintenance simplifiée. Il intègre également des baies d'extension modulaires pour la mise en réseau NVIDIA ConnectX-9 800 Gbit/s et NVIDIA Rubin CPX, prenant en charge les tâches d'inférence à grande échelle.

La carte NVIDIA Vera Rubin NVL144 représente une avancée significative en matière d'architecture de calcul accéléré et de capacités d'IA. Elle est conçue pour prendre en charge les moteurs de raisonnement avancés et répondre aux besoins des agents d'IA.

La conception principale repose sur l'architecture rack MGX et sera prise en charge par plus de 50 partenaires systèmes et composants MGX. NVIDIA prévoit de proposer au consortium OCP les innovations en matière de racks et de plateaux de calcul améliorés sous forme de norme ouverte.

Ses normes pour les plateaux et racks de calcul permettent aux partenaires d'assembler des systèmes modulaires et d'évoluer plus rapidement avec l'architecture. La conception du rack Vera Rubin NVL144 est dotée d'un refroidissement liquide à 45 °C écoénergétique, d'un nouveau jeu de barres refroidi par liquide pour des performances accrues et d'un stockage d'énergie 20 fois supérieur pour une alimentation constante.

Les améliorations MGX apportées à l'architecture du plateau de calcul et du rack améliorent les performances de l'usine d'IA et facilitent l'assemblage, permettant une mise à l'échelle rapide vers une infrastructure d'IA de niveau gigawatt.

L'écosystème NVIDIA NVLink Fusion s'étend

Outre le matériel, NVIDIA NVLink Fusion prend de l'ampleur, permettant aux entreprises d'intégrer de manière transparente leur silicium semi-personnalisé dans une architecture de centre de données hautement optimisée et largement déployée, réduisant ainsi la complexité et accélérant la mise sur le marché.

Intel et Samsung Foundry rejoignent l'écosystème NVLink Fusion, qui englobe des concepteurs de silicium personnalisés, des partenaires CPU et IP, permettant aux usines d'IA de faire évoluer et de gérer rapidement des charges de travail intensives pour la formation de modèles et l'inférence d'IA agentique.

  • Dans le cadre de l'annonce récente Collaboration NVIDIA et Intel, Intel construira des processeurs x86 qui s'intégreront aux plates-formes d'infrastructure NVIDIA à l'aide de NVLink Fusion.
  • Samsung Foundry s'est associé à NVIDIA pour répondre à la demande croissante de processeurs et de XPU personnalisés, offrant une expérience de la conception à la fabrication de silicium personnalisé.

NVIDIA Kyber Rack

Plus de 20 partenaires industriels présenteront de nouveaux composants, circuits d'alimentation et supports pour les centres de données à courant continu (CC) 800 volts de nouvelle génération. Conçus pour l'ère du gigawatt, ces centres prendront en charge l'architecture rack Kyber de NVIDIA.

Foxconn a dévoilé des détails sur son centre de données taïwanais de 40 mégawatts, Kaohsiung-1, conçu pour l'ère du 800 V CC. D'autres leaders du secteur, dont CoreWeave, Lambda, Nebius, Oracle Cloud Infrastructure et Together AI, planifient également des centres de données intégrant une infrastructure 800 V CC. De plus, Vertiv a présenté son architecture de référence MGX 800 V CC, une solution conçue pour optimiser l'espace, les coûts et l'efficacité énergétique tout en offrant une infrastructure complète d'alimentation et de refroidissement. HPE prend également en charge les produits NVIDIA Kyber et la technologie évolutive Ethernet NVIDIA Spectrum-XGS, deux éléments essentiels de la plateforme Ethernet Spectrum-X.

Passer des systèmes triphasés conventionnels de 415 ou 480 VCA à une infrastructure 800 VCC offre une plus grande évolutivité, une meilleure efficacité énergétique, une consommation de matériaux réduite et des performances accrues dans les centres de données. Les secteurs des véhicules électriques et de l'énergie solaire ont déjà mis en œuvre une infrastructure 800 VCC pour bénéficier de ces avantages.

Génération de serveurs NVIDIA Kyber Rack

L'écosystème OCP se prépare également à NVIDIA Kyber, qui présente des innovations en matière d'alimentation électrique de 800 VCC, de refroidissement liquide et de conception mécanique.

Ces innovations faciliteront la transition vers la génération de serveurs rack NVIDIA Kyber, successeur de NVIDIA Oberon, qui devrait comporter une plateforme haute densité avec 576 GPU NVIDIA Rubin Ultra d'ici 2027.

La meilleure approche pour relever les défis de la distribution de haute puissance consiste à augmenter la tension. Passer d'un système triphasé standard de 415 ou 480 VCA à un système de 800 VCC offre plusieurs avantages.

La transition en cours permet aux partenaires de serveurs rack de faire passer leurs composants en rack de 54 VCC à 800 VCC, améliorant ainsi les performances. Lors de cet événement, un écosystème collaboratif composé de fournisseurs d'infrastructures à courant continu, de partenaires en systèmes d'alimentation et de refroidissement, et de fabricants de silicium, a collaboré à l'élaboration de normes ouvertes pour l'architecture de référence des serveurs rack MGX.

NVIDIA Kyber vise à augmenter la densité des GPU en rack, à accroître la capacité du réseau et à optimiser les performances des systèmes d'IA à grande échelle. Il propose un montage vertical des lames de calcul, prenant en charge jusqu'à 18 lames par châssis. De plus, les lames de commutation NVLink spécialisées de NVIDIA sont positionnées à l'arrière via un fond de panier sans câble, facilitant ainsi une connectivité réseau transparente et évolutive.

Plus de 150 % de puissance supplémentaire est transmise via le même cuivre avec 800 VCC, éliminant ainsi le besoin de barres omnibus en cuivre de 200 kg pour alimenter un seul rack.

Kyber est appelé à devenir un composant essentiel des centres de données d'IA hyperscale, améliorant les performances, l'efficacité et la fiabilité des tâches d'IA générative avancées. Les racks NVIDIA Kyber permettent aux clients de réduire considérablement l'utilisation du cuivre, générant ainsi des économies de plusieurs millions de dollars.

Mise à l'échelle de la prochaine génération d'usines d'IA

Plus de 20 partenaires NVIDIA contribuent à fournir des serveurs en rack avec des normes ouvertes, permettant ainsi la création des futures usines d'IA du gigawatt.

  • Fournisseurs de silicium:Analog Devices, Inc. (ADI), A, EPC, Infineon, Innoscience, MPS, Navitas, onsemi, Power Integrations, Renesas, Richtek, ROHM, STMicroelectronics et Texas Instruments
  • Fournisseurs de composants de systèmes électriques: Bizlink, Delta, Fléchir, GE Vernova, Lead Wealth, LITEON et Megmeet
  • Fournisseurs de systèmes d'alimentation pour centres de données:ABB, Eaton, GE Vernova, Heron Power, Hitachi Énergie, Mitsubishi Electric, Schneider Electric, Siemens et Vertiv

NVIDIA contribue activement aux normes OCP pour plusieurs générations de matériel, notamment à des éléments clés de la conception électromécanique du système NVIDIA GB200 NVL72. Le format rack MGX est compatible avec le GB300 NVL72 et sera compatible avec les Vera Rubin NVL144, Vera Rubin NVL144 CPX et Vera Rubin CPX pour des performances accrues et des déploiements rapides.

S'engager avec StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Flux RSS

Harold Fritt

Je suis dans l'industrie de la technologie depuis qu'IBM a créé Selectric. Ma formation, cependant, est l'écriture. J'ai donc décidé de sortir de l'avant-vente et de revenir à mes racines, en écrivant un peu mais en restant impliqué dans la technologie.