StorageReview.com

Une nouvelle vague d'innovation NVIDIA HPC annoncée

Entreprise

NVIDIA a profité du SC22 pour faire des annonces mettant en lumière une nouvelle vague d'innovation HPC qui permet des découvertes scientifiques révolutionnaires. NVIDIA a mis en avant Quantum-2, Omniverse, HPC à la périphérie et Digital Twin Simulation. Voici la compilation NVIDIA.

La première annonce concerne l'adoption généralisée de ses GPU H100 Tensor Core de nouvelle génération et de Quantum-2 InfiniBand , avec notamment de nouvelles offres sur le cloud Microsoft Azure et plus de 50 nouveaux systèmes partenaires pour accélérer la découverte scientifique.

NVIDIA HGX-H100

NVIDIA a publié des mises à jour importantes de ses bibliothèques d'accélération cuQuantum, CUDA et BlueField DOCA et a annoncé la prise en charge de sa plate-forme de simulation Omniverse sur les systèmes équipés de NVIDIA A100 et H100. H100, Quantum-2 et les mises à jour de la bibliothèque font tous partie de la plate-forme HPC de NVIDIA. La plate-forme HPC comprend une pile technologique complète avec des CPU, des GPU, des DPU, des systèmes, des réseaux et une large gamme de logiciels d'IA et de HPC offrant aux chercheurs la possibilité d'accélérer efficacement leur travail sur des systèmes puissants, sur site ou dans le cloud.

Azure propose NVIDIA Quantum-2 pour les charges de travail HPC

L'adoption par Microsoft Azure de la plate-forme réseau Quantum-2 InfiniBand fait suite à la disponibilité générale de NVIDIA Quantum-2 annoncée au GTC en mars.

Nouveaux serveurs turbocompressés avec H100, NVIDIA AI

ASUS, Atos, Dell, HPE, Lenovo et Supermicro ne sont que quelques-uns des partenaires NVIDIA à annoncer des serveurs alimentés par H100. Une licence de cinq ans pour NVIDIA AI Enterprise est incluse avec chaque GPU H100 PCIe. Cela garantit aux organisations l'accès aux cadres et aux outils d'IA nécessaires pour créer des solutions d'IA accélérées par H100, de l'imagerie médicale aux modèles météorologiques en passant par les systèmes d'alerte de sécurité, etc.

Parmi la vague de nouveaux systèmes figure le Dell PowerEdge XE9680, également annoncé lors du SC22, qui s'attaque aux charges de travail les plus exigeantes en matière d'IA et de hautes performances. Il s'agit du premier système à huit voies de Dell basé sur la plate-forme NVIDIA HGX spécialement conçue pour la convergence de la simulation, de l'analyse de données et de l'IA.

Le PowerEdge XE8640, nouveau système Dell HGX H100 doté de quatre GPU Hopper, permet aux entreprises de développer, d'entraîner et de déployer des modèles d'IA et d'apprentissage automatique. Ce système rack 4U offre des performances d'entraînement IA accrues et des capacités de calcul optimisées grâce à quatre emplacements PCIe Gen5, la technologie NVIDIA Multi-Instance GPU (MIG) et la prise en charge du stockage NVIDIA GPUDirect.

Mises à jour majeures des bibliothèques d'accélération

Pour aider à stimuler la découverte scientifique, NVIDIA a publié des mises à jour importantes de ses bibliothèques d'accélération CUDA, cuQuantum et DOCA, notamment :

  • Les bibliothèques NVIDIA CUDA incluent désormais un Eigensolver multi-nœuds et multi-GPU permettant une évolutivité et des performances sans précédent pour les principales applications HPC telles que VASP, un package pour les premiers principes de calculs de mécanique quantique.
  • Le kit de développement logiciel NVIDIA cuQuantum pour accélérer les workflows d'informatique quantique prend désormais en charge les méthodes de réseau de tenseurs approximatifs. Cela permet aux chercheurs de simuler des dizaines de milliers de qubits et active automatiquement la prise en charge multi-nœuds et multi-GPU pour la simulation quantique avec des performances inégalées à l'aide de l'appliance cuQuantum.
  • NVIDIA DOCA, le SDK cloud ouvert et le framework d'accélération pour les DPU NVIDIA BlueField, inclut une programmabilité, une sécurité et des fonctionnalités avancées pour prendre en charge de nouveaux cas d'utilisation du stockage.

Ces bibliothèques permettent aux chercheurs d'évoluer sur plusieurs serveurs et de les doter d'améliorations des performances pour favoriser la découverte scientifique. Les bibliothèques d'accélération NVIDIA HPC sont disponibles sur les principales plateformes cloud AWS, Google Cloud, Microsoft Azure et Oracle Cloud Infrastructure.

Portails ouverts omnivers pour les scientifiques

Ensuite, NVIDIA a annoncé que NVIDIA Omniverse se connecte désormais aux principaux logiciels de visualisation de calcul scientifique et prend en charge de nouvelles charges de travail de rendu par lots sur les systèmes alimentés par les GPU NVIDIA A100 et H100 Tensor Core.

NVIDIA a également introduit des jumeaux numériques scientifiques et industriels en temps réel pour la communauté informatique haute performance, activés par NVIDIA OVX, un système informatique conçu pour alimenter les jumeaux numériques Omniverse à grande échelle, et Omniverse Cloud, un logiciel et une infrastructure en tant que -l'offre de services.

Omniverse prend désormais en charge les charges de travail par lots que les chercheurs, scientifiques et ingénieurs en IA et HPC peuvent exécuter sur leurs systèmes A100 ou H100 existants.

NVIDIA a également dévoilé des connexions à des outils informatiques scientifiques populaires tels que ParaView de Kitware, une application de visualisation ; NVIDIA IndeX pour le rendu volumétrique ; NVIDIA Modulus pour le développement de modèles physiques-ML ; et NeuraVDB pour la représentation de données volumétriques clairsemées à grande échelle.

À l'aide de charges de travail Omniverse et de cloud hybride, les clients du calcul scientifique peuvent connecter des pipelines de simulation et de visualisation hérités pour obtenir une véritable interaction distribuée, entièrement interactive et en temps réel avec leurs modèles et ensembles de données. Les clients NVIDIA tels que Argonne National Laboratory, Lockheed Martin et Princeton Plasma Physics Laboratory constatent déjà les avantages d'Omniverse pour les charges de travail HPC.

Omniverse reçoit le soutien de leaders scientifiques mondiaux.

Le laboratoire national d'Argonne utilise NVIDIA Omniverse sur son supercalculateur Polaris alimenté par A100 pour connecter ses outils de visualisation hérités comme première étape pour développer les bases des futurs jumeaux numériques.

Princeton Plasma Physics Laboratory (PPPL), le laboratoire national du Département américain de l'énergie pour la physique des plasmas et la science de la fusion, utilise Omniverse pour connecter et accélérer des simulateurs HPC synthétiques en temps réel de pointe pour modéliser des dispositifs de fusion et contrôler systèmes et finalement améliorer le fonctionnement de l'expérience vers une nouvelle source d'énergie propre commercialement viable.

S'alignant sur l'initiative Earth-2 de NVIDIA pour accélérer la recherche sur le climat, le leader de l'aérospatiale Lockheed Martin a récemment commencé à utiliser NVIDIA Omniverse pour fournir à la National Oceanic and Atmospheric Administration (NOAA) des États-Unis une meilleure connaissance globale de l'environnement et de la situation et pour développer un pipeline de recherche climatique interactif.

Disponibilité

Ces nouvelles fonctionnalités sont désormais prises en charge dans NVIDIA Omniverse et disponibles pour les développeurs et les entreprises.

La plate-forme NVIDIA résout les problèmes HPC à la périphérie

Les universités et les entreprises qui partagent leur travail sur de longues distances ont besoin d'un langage commun et d'un pipeline sécurisé pour que chaque appareil, des microscopes et capteurs aux serveurs et réseaux de campus, puisse voir et comprendre les données transmises. La quantité croissante de données qui doivent être stockées, transmises et analysées ne fait qu'aggraver le défi.

NVIDIA résout le problème en introduisant une plate-forme informatique hautes performances qui combine l'informatique de pointe et l'IA pour capturer et consolider les données en continu à partir d'instruments scientifiques de pointe permettant aux appareils de se parler sur de longues distances.

La plate-forme se compose de trois composants principaux, les DPU NVIDIA Holoscan, MetroX-3 et NVIDIA BlueField-3. NVIDIA Holoscan est un kit de développement logiciel que les scientifiques des données et les experts du domaine peuvent utiliser pour créer des pipelines accélérés par GPU pour les capteurs qui diffusent des données. MetroX-3 est un nouveau système longue distance qui étend la connectivité de la plate-forme NVIDIA Quantum-2 InfiniBand. Et les DPU NVIDIA BlueField-3 permettent une migration de données sécurisée et intelligente.

Les chercheurs peuvent utiliser la nouvelle plate-forme NVIDIA pour l'informatique de pointe HPC pour communiquer et collaborer en toute sécurité sur la résolution de problèmes et rassembler leurs appareils et algorithmes disparates pour fonctionner comme un seul grand supercalculateur.

Holoscan pour le HPC à la périphérie

Accéléré par les plates-formes de calcul GPU qui incluent les systèmes NVIDIA IGX, HGX et DGX, NVIDIA Holoscan offre les performances extrêmes requises pour traiter des flux massifs de données générés par les instruments scientifiques du monde.

NVIDIA Holoscan pour HPC inclut de nouvelles API pour C++ et Python que les chercheurs HPC peuvent utiliser pour créer des flux de travail de traitement des données de capteur suffisamment flexibles pour les formats autres que les images et suffisamment évolutifs pour traduire les données brutes en informations en temps réel.

Holoscan gère également l'allocation de mémoire pour garantir des échanges de données sans copie, afin que les développeurs puissent se concentrer sur la logique du flux de travail et ne pas se soucier de la gestion des E/S de fichiers et de mémoire.

Les nouvelles fonctionnalités d'Holoscan seront disponibles pour tous les développeurs HPC le mois prochain.

MetroX-3 tient la distance

Le système longue distance NVIDIA MetroX-3, disponible le mois prochain, étend les dernières fonctionnalités cloud natives de la plate-forme NVIDIA Quantum-2 InfiniBand de la périphérie au cœur du centre de données HPC. Il permet aux GPU entre les sites de partager en toute sécurité des données sur le réseau InfiniBand jusqu'à 25 miles (40 km).

Tirant parti de l'accès direct à la mémoire à distance natif, les utilisateurs peuvent facilement migrer les données et les travaux de calcul d'un mini-cluster connecté à InfiniBand vers le centre de données principal ou combiner des clusters de calcul dispersés géographiquement pour des performances et une évolutivité globales supérieures.

Les opérateurs de centres de données peuvent provisionner, surveiller et opérer sur tous les réseaux de centres de données connectés à InfiniBand en utilisant NVIDIA Unified Fabric Manager pour gérer leurs systèmes MetroX-3.

BlueField pour un HPC sécurisé et efficace

Les DPU NVIDIA BlueField déchargent, accélèrent et isolent les services avancés de mise en réseau, de stockage et de sécurité pour améliorer les performances et l'efficacité du HPC moderne.

NVIDIA apporte la simulation de jumeau numérique aux opérateurs de centres de données HPC

La simulation et les jumeaux numériques peuvent aider les concepteurs, les constructeurs et les opérateurs de centres de données à créer des installations hautement efficaces et performantes. La plate-forme de simulation NVIDIA Omniverse contribue à rationaliser le processus de conception virtuelle collaborative.

Omniverse permet désormais aux opérateurs de centres de données d'agréger les entrées en temps réel de leurs principales applications tierces de conception, de simulation et de surveillance assistées par ordinateur afin qu'ils puissent voir et travailler avec leurs ensembles de données complets en temps réel.

La démo SC22 Omniverse montre comment Omniverse permet aux utilisateurs d'exploiter la puissance du calcul accéléré, de la simulation et des jumeaux numériques opérationnels connectés à la surveillance en temps réel et à l'IA. Cela permet aux équipes de rationaliser la conception des installations, d'accélérer la construction et le déploiement et d'optimiser les opérations en cours.

La démo a également mis en évidence NVIDIA Air, une plate-forme de simulation de centre de données conçue pour fonctionner avec Omniverse pour simuler le réseau. Avec NVIDIA Air, les équipes peuvent modéliser l'intégralité de la pile réseau, ce qui leur permet d'automatiser et de valider le matériel et les logiciels réseau avant la mise en service.

Créer des jumeaux numériques pour améliorer la conception et la simulation

Lors de la planification et de la construction de l'un des derniers supercalculateurs IA de NVIDIA, plusieurs jeux de données CAO d'ingénierie ont été collectés à partir d'outils industriels tiers tels qu'Autodesk Revit, PTC Creo et Trimble SketchUp. Cela a permis aux concepteurs et aux ingénieurs de visualiser le modèle basé sur la description de scène universelle en toute fidélité, et ils ont pu itérer en collaboration sur la conception en temps réel.

PATCH MANAGER est une application logicielle d'entreprise pour la planification du câblage, des actifs et de la connectivité point à point de la couche physique dans les domaines du réseau. Avec PATCH MANAGER connecté à Omniverse, la topologie complexe des connexions port à port, la disposition des racks et des nœuds et le câblage peuvent être intégrés directement dans le modèle réel. Cela permet aux ingénieurs du centre de données d'avoir une vue complète du modèle et de ses dépendances.

Pour prédire les flux d'air et les transferts de chaleur, les ingénieurs ont utilisé Cadence 6SigmaDCX, un logiciel de dynamique des fluides computationnelle. Les ingénieurs peuvent également utiliser des substituts d'IA formés avec NVIDIA Modulus pour une analyse "what-if" en temps quasi réel. Cela permet aux équipes de simuler des changements dans les thermiques et le refroidissement complexes, et ils peuvent voir les résultats instantanément.

Et avec NVIDIA Air, la topologie exacte du réseau, y compris les protocoles, la surveillance et l'automatisation, peut être simulée et prévalidée.

Une fois qu'un centre de données est construit, ses capteurs, son système de contrôle et sa télémétrie peuvent être connectés au jumeau numérique à l'intérieur d'Omniverse, permettant une surveillance en temps réel des opérations.

Les ingénieurs peuvent simuler des dangers courants tels que les pics de puissance ou les pannes du système de refroidissement avec un jumeau numérique parfaitement synchronisé. Les opérateurs peuvent bénéficier des changements recommandés par l'IA qui optimisent les priorités clés telles que l'amélioration de l'efficacité énergétique et la réduction de l'empreinte carbone. Le jumeau numérique leur permet également de tester et de valider les mises à niveau des logiciels et des composants avant le déploiement dans le centre de données physique.

S'engager avec StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Flux RSS

Harold Fritt

Je suis dans l'industrie de la technologie depuis qu'IBM a créé Selectric. Ma formation, cependant, est l'écriture. J'ai donc décidé de sortir de l'avant-vente et de revenir à mes racines, en écrivant un peu mais en restant impliqué dans la technologie.