Les infrastructures d'IA sont notoirement gourmandes en ressources, et les entreprises sont constamment confrontées au défi d'optimiser l'utilisation des GPU. Dell Technologies, grâce à sa plateforme AI Factory, relève ce défi en intégrant la solution d'orchestration récemment acquise par NVIDIA. Exécuter : ai. Dans un récent Blog Dell, la société a souligné comment Run:ai maximise l'utilisation des ressources et accélère les résultats de l'IA, transformant la façon dont les entreprises déploient et gèrent les ressources GPU à grande échelle.
Cluster Dell NVL72
Qu'est-ce que Run:ai exactement ?
Run:ai est une plateforme d'orchestration basée sur Kubernetes, spécialement conçue pour les charges de travail centrées sur les GPU. Fondée en 2018, Run:ai a gagné en popularité en s'attaquant à un problème majeur du secteur : l'utilisation inefficace des GPU. Traditionnellement, les GPU affectés aux charges de travail d'IA sont souvent inutilisés ou sous-utilisés. Run:ai résout ce problème en mutualisant dynamiquement et en planifiant intelligemment les ressources GPU, permettant ainsi une allocation fractionnée des GPU, des déploiements multi-GPU efficaces et une gestion transparente dans les environnements hybrides, cloud et sur site.
Reconnaissant le potentiel de Run:ai pour remodeler radicalement l'infrastructure de l'IA, NVIDIA a finalisé son acquisition de l'entreprise en décembre 2024 pour environ 700 millions de dollars. Il est intéressant de noter que NVIDIA s'est engagé à terme à rendre Run:ai open source, témoignant ainsi de sa volonté de favoriser une adoption plus large de l'écosystème au-delà de ses plateformes matérielles. Cette initiative devrait accélérer l'innovation et l'efficacité globale du secteur.
Pour ceux qui recherchent une perspective technique plus approfondie sur la gestion des ressources, Détails de la documentation de NVIDIA Comment Run:ai est essentiel pour orchestrer les charges de travail sur les systèmes GB200 NVL72. Le document met en évidence une lacune critique : Kubernetes ne reconnaît pas nativement l'architecture MNNVL de NVIDIA, ce qui complexifie la gestion et la planification des charges de travail sur ces domaines hautes performances. Run:ai élimine cette complexité en détectant automatiquement les domaines NVLink et en simplifiant la soumission des charges de travail distribuées. Cela garantit que les pods sont correctement placés sur les nœuds dotés d'interconnexions NVLink, éliminant ainsi le besoin de connaissances matérielles approfondies ou de configuration manuelle pour chaque tâche. Ces fonctionnalités démontrent comment la plateforme rationalise les opérations dans des environnements de formation denses, permettant aux entreprises d'exploiter pleinement la puissance des configurations matérielles avancées, telles que le GB200 NVL72.
Pourquoi cela est important pour l'entreprise
Pour les organisations exécutant des charges de travail gourmandes en ressources GPU, notamment celles impliquant l'IA générative et les modèles de langage volumineux, la sous-utilisation du GPU représente un risque important : un gaspillage d'investissement. Run:ai corrige directement ces inefficacités, grâce à Rapports NVIDIA que les organisations utilisant la plateforme peuvent constater des améliorations de l'utilisation du GPU jusqu'à cinq fois.
Ce niveau d'optimisation améliore non seulement le retour sur investissement, mais transforme également fondamentalement l'efficacité opérationnelle. Les équipes auparavant limitées par des ressources limitées et des processus de planification complexes disposent désormais des outils nécessaires pour déployer davantage de modèles simultanément, évoluer rapidement et expérimenter de manière plus intensive, le tout sans investissement matériel supplémentaire. Si ces méthodologies sont courantes dans les déploiements HPC à grande échelle, le niveau d'efficacité requis pour optimiser l'utilisation des GPU est moins courant en entreprise.
Dynamique générale de l'industrie
Plusieurs grands fournisseurs d’infrastructures adoptent la plateforme, signalant un élan croissant dans le paysage informatique de l’entreprise.
Dell Dell continue d'étendre son infrastructure AI Factory, en s'appuyant sur les technologies NVIDIA, dont Run:ai. L'utilisation de Run:ai par Dell illustre comment les entreprises peuvent passer d'une allocation manuelle et cloisonnée des ressources à une planification automatisée et dynamique, gage d'une efficacité accrue dans les environnements multi-locataires.
HPE propose Run:ai dans le cadre de sa marketplace GreenLake, en l'intégrant à la plateforme Ezmeral pour permettre une planification GPU avancée, une allocation fractionnée et une orchestration d'infrastructure hybride. Les clients peuvent ainsi déployer et gérer leurs charges de travail d'IA avec une précision et une évolutivité accrues.
Cisco intègre Run:ai à ses serveurs UCS X-Series et à sa plateforme d'opérations cloud Intersight. Sa solution met en avant la gestion des quotas, le partage fractionné de GPU et la surveillance en temps réel pour soutenir les déploiements d'IA à grande échelle sur site.
Nous avons présenté quelques-uns des partenaires de Run:ai. NVIDIA possède une longue liste de logos, comme indiqué ci-dessus. De nombreux OEM et fournisseurs de plateformes cloud de premier plan s'associent à Run:ai pour proposer des solutions d'infrastructure d'IA plus innovantes et plus performantes.




Amazon