StorageReview.com

Google Ironwood TPU : une avancée majeure dans les performances d'inférence de l'IA

AI  ◇  Entreprise

La semaine dernière, Google a dévoilé son dernier accélérateur d'IA personnalisé, l'Ironwood TPU, qui présente une amélioration significative des performances pour le monde de plus en plus exigeant de l'IA. Annoncé lors du Google Cloud Next 25, Ironwood est la septième génération de TPU de Google, spécialement conçue pour gérer les charges de travail de l'IA moderne, notamment dans le domaine de l'inférence.

TPU Ironwood

Comprendre les TPU

Avant de se plonger dans Ironwood, il est utile de comprendre ce que sont les TPU. Les unités de traitement tensorielles (Tensor Processing Units) sont des puces spécialisées développées par Google pour accélérer les charges de travail d'apprentissage automatique. Contrairement aux processeurs (CPU) à usage général, voire aux GPU, optimisés pour le traitement parallèle, initialement destinés aux graphiques, les TPU sont optimisés pour les opérations matricielles et tensorielles au cœur des réseaux neuronaux. Historiquement, Google a proposé différentes versions de TPU, distinguant souvent la série « e » (axée sur l'efficacité et l'inférence, exécutant des modèles pré-entraînés) et la série « p » (axée sur les performances brutes pour l'entraînement de modèles volumineux).

Présentation d'Ironwood 

La nouvelle TPU Ironwood est l'accélérateur d'IA le plus ambitieux de Google à ce jour. C'est la première TPU de l'entreprise spécifiquement conçue pour répondre aux exigences des « modèles de raisonnement » à forte composante d'inférence. Ironwood apporte des améliorations substantielles à tous les indicateurs de performance clés par rapport à ses prédécesseurs, notamment :

TPU v5e TPU v5p TPU v6e TPU v7e
Calcul BF16 TFLOP 197 TFLOP 459 TFLOP 918 2.3 PFLOP*
Calcul INT8/FP8 394 TOP/TFLOP* 918 TOP/TFLOP* 1836 TOP/TFLOP 4.6 POP/PFLOP
Bande passante HBM 0.8 TB / s 2.8 TB / s 1.6 TB / s 7.4 TB / s
Capacité HBM 16 GB 95 GB 32 GB 192 GB
Bande passante d'interconnexion inter-puces (par liaison) 400 Gbps 800 Gbps 800 Gbps 1200 Gbps
Topologie d'interconnexion Tore 2D Tore 3D Tore 2D Tore 3D
Taille du pod TPU 256 8960 256 9216
Noyaux de rechange Non Non Oui Oui

Remarque : les nombres marqués d’un « * » sont des nombres calculés non officiels.

Plus particulièrement, Ironwood présente :

  • Puissance de calcul massive : chaque puce offre 4.6 pétaFLOPS de performances FP8, ce qui la place dans la même classe de performances que le Blackwell B200 de NVIDIA
  • Capacité de mémoire accrue : 192 Go de mémoire à large bande passante (HBM) par puce
  • Bande passante mémoire considérablement améliorée : 7.37 To/s par puce, soit 4.5 fois plus que Trillium, permettant un accès plus rapide aux données pour l'inférence IA à mémoire limitée
  • Capacités d'interconnexion améliorées : bande passante bidirectionnelle de 1.2 To/s, soit une amélioration de 1.5 fois par rapport à Trillium, facilitant une communication plus efficace entre les puces

Spéculations : Ironwood est-il le v6p manquant ?

Il est intéressant de noter que Google semble avoir ignoré la génération TPU v6p attendue et lancé directement la v7e Ironwood. Cela suggère que cette puce était peut-être initialement destinée à servir de puce d'entraînement v6p. Cependant, en raison de l'expansion rapide des tailles des modèles et de la nécessité de concurrencer des offres comme le GB200 NVL72 de NVIDIA, Google l'a probablement repositionnée sous le nom de v7e Ironwood. La taille imposante du module TPU 9216 et l'utilisation de l'interconnexion 3D Torus dans ce qui est désigné comme une puce de la série « e » (généralement la variante la plus économique) étayent fortement cette théorie.

La route à suivre

Google a annoncé que les TPU Ironwood seront disponibles plus tard cette année via Google Cloud. Cette technologie équipe déjà certains des systèmes d'IA les plus avancés de Google, notamment Gemini 2.5 et AlphaFold.

À mesure que ces nouveaux accélérateurs puissants seront mis à la disposition des développeurs et des chercheurs, ils permettront probablement des avancées dans les capacités de l’IA, en particulier pour les charges de travail d’inférence à grande échelle qui nécessitent à la fois une puissance de calcul massive et des capacités de raisonnement sophistiquées.

S'engager avec StorageReview

Newsletter | YouTube | Podcast iTunes / Spotify | Instagram | Twitter | TikTok | Flux RSS

Divyansh Jain

Ingénieur en apprentissage automatique, passionné de technologies et de laboratoires personnels. Chez StorageReview, je dirige les tests d'IA et de charges de travail émergentes, et je fournis des analyses de performance et des informations précieuses.