StorageReview.com

VAST Data et AMD annoncent un temps d'obtention du premier jeton 9 fois plus rapide grâce au déchargement du cache KV sur Instinct.

AI  ◇  Entreprise

VAST Data a étendu sa collaboration avec AMD autour de l'infrastructure d'IA pour les fournisseurs de cloud et les entreprises déployant des services d'entraînement, d'inférence, de génération augmentée par la recherche et d'IA agentielle. Ce projet combine le système d'exploitation d'IA de VAST avec les processeurs AMD EPYC de 6e génération , les GPU AMD Instinct, le matériel réseau AMD et le logiciel ROCm.

Cette collaboration témoigne d'une évolution plus large des infrastructures, passant de clusters d'IA axés sur l'entraînement à des environnements qui doivent également prendre en charge le contexte persistant, l'inférence à haute concurrence et les flux de travail multi-agents. Ces déploiements mettent davantage l'accent sur la circulation des données, la gestion du cache clé-valeur, l'utilisation des GPU et la capacité à fournir un accès à faible latence à de vastes ensembles de données de modèles et de contexte.

VAST positionne son architecture DASE (Disaggregated Shared Everything ) comme la couche de données partagée de ces environnements. La plateforme combine le stockage de fichiers et d'objets, les bases de données, le flux d'événements et les services de données au sein d'un espace de noms global unifié. Elle offre également des fonctionnalités de mutualisation et d'isolation des charges de travail pour les clouds d'IA exécutant simultanément des charges de travail client et applicatives.

Plateformes EPYC 9006 pour les systèmes VAST CBox et EBox

VAST a sélectionné les processeurs AMD EPYC de 6e génération, anciennement connus sous le nom de code Venice, pour ses plateformes CBox et EBox de nouvelle génération. L'entreprise prévoit d'utiliser ces processeurs dans ses systèmes CBox de sixième génération et EBox de troisième génération, qui constituent la base du système d'exploitation d'intelligence artificielle VAST.

La prise en charge du processeur graphique AMD EPYC 9006 introduit la connectivité PCIe Gen6 sur la plateforme matérielle VAST. VAST indique que cette nouvelle interface double la bande passante d'E/S, améliorant ainsi le débit de stockage des fichiers et des objets tout en réduisant la latence des services de données tels que les bases de données, les entrepôts de données et les flux d'événements fournis par VAST DataBase et DataEngine.

Pour les infrastructures d'IA, une bande passante d'E/S plus élevée peut contribuer à réduire les goulots d'étranglement entre les ressources de calcul, de réseau et de stockage NVMe. Ceci est particulièrement pertinent pour le chargement de modèles, les pipelines de récupération, l'accès aux points de contrôle et les flux de travail de cache KV externalisé, où la capacité de mémoire du GPU seule est insuffisante pour conserver le contexte actif.

Architecture de référence combinant Helios, VAST et DriveNets

VAST, AMD et DriveNets développent également une architecture de référence d'infrastructure d'IA construite autour de l'infrastructure d'IA à l'échelle du rack AMD Helios, du système d'exploitation d'IA VAST et du réseau DriveNets AI Fabric.

L'architecture de référence vise à fournir des recommandations de déploiement pour l'entraînement de modèles, l'inférence, l'apprentissage par renforcement et les charges de travail de cache clé-valeur. Elle prend en compte le dimensionnement et la disponibilité pour les organisations qui développent des plateformes d'IA nécessitant une infrastructure de données partagée, un réseau haute performance et des capacités de calcul GPU.

VAST a également fait état d'une collaboration renforcée avec les fournisseurs de logiciels d'inférence TensorMesh et EmbeddedLLM. Cet effort écosystémique est axé sur les architectures d'inférence de production pour les applications d'IA multi-agents, bien que les détails concernant l'intégration et la disponibilité des produits n'aient pas été divulgués.

Déchargement du cache KV cible l'inférence à haute concurrence

L'un des éléments centraux de cette annonce est la prise en charge étendue du cache KV grâce aux GPU AMD Instinct , à AMD Infinity Context, au logiciel ROCm et au système d'exploitation d'IA VAST.

AMD Instinct MI355

Les données du cache KV stockent les informations intermédiaires relatives à l'état d'attention générées lors de l'inférence. La conservation de ces données améliore les performances pour les interactions à plusieurs tours et les charges de travail nécessitant un contexte long, mais une empreinte mémoire cache importante peut consommer une quantité considérable de mémoire GPU. L'externalisation ou la hiérarchisation du cache KV vers une plateforme de stockage haute performance permet de libérer de la mémoire GPU pour les charges de travail actives tout en conservant le contexte pour les requêtes d'inférence ultérieures.

VAST a annoncé des tests préliminaires réalisés avec un GPU AMD Instinct MI355X, démontrant une amélioration de 9 fois du temps d'obtention du premier jeton et un débit de jetons 9.7 fois supérieur lors de l'utilisation de VAST pour le déchargement du cache KV dans des charges de travail d'IA multi-agents à haute concurrence. L'entreprise précise que ces résultats dépendent de la configuration matérielle de base, des caractéristiques de la charge de travail et de la configuration de stockage.

L'intégration applique également les politiques de cycle de vie VAST aux données du cache KV. Cette fonctionnalité vise à faire expirer et supprimer automatiquement les informations mises en cache, ce qui est important lorsque le contexte d'inférence contient des données sensibles, personnelles ou réglementées.

Pensando Pollara 400 connecte les GPU à un stockage partagé

L'architecture utilise la carte réseau AMD Pensando Pollara 400 AI pour connecter les GPU AMD Instinct au cluster de stockage VAST. Selon VAST, cette carte réseau prend en charge le transfert de données entre le GPU et le stockage via NFS sur TCP et RDMA, permettant ainsi l'accès aux clusters VAST basés sur des SSD NVMe pour le cache KV et les besoins plus larges en matière de données d'inférence.

La conception qui en résulte vise à prendre en charge les environnements d'IA nécessitant une gestion du contexte à grande échelle, indépendamment de la mémoire GPU. Plutôt que de considérer le stockage comme une couche de persistance distincte, VAST positionne la plateforme comme une couche de données et d'exécution capable de gérer les modèles, les bases de données, les flux de données, les fichiers et le contexte d'IA au sein d'une infrastructure distribuée.

Pour les fournisseurs de cloud IA, cette approche vise une utilisation accrue des GPU et une efficacité opérationnelle améliorée, à mesure que les déploiements évoluent au-delà de la location de GPU et de l'entraînement par lots vers l'inférence persistante et les services d'IA agentifs.

S'engager avec StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Flux RSS

Harold Fritt

Je suis dans l'industrie de la technologie depuis qu'IBM a créé Selectric. Ma formation, cependant, est l'écriture. J'ai donc décidé de sortir de l'avant-vente et de revenir à mes racines, en écrivant un peu mais en restant impliqué dans la technologie.