La semaine dernière, Google a dévoilé son dernier accélérateur d'IA personnalisé, l'Ironwood TPU, qui présente une amélioration significative des performances pour le monde de plus en plus exigeant de l'IA. Annoncé lors du Google Cloud Next 25, Ironwood est la septième génération de TPU de Google, spécialement conçue pour gérer les charges de travail de l'IA moderne, notamment dans le domaine de l'inférence.
Comprendre les TPU
Avant de se plonger dans Ironwood, il est utile de comprendre ce que sont les TPU. Les unités de traitement tensorielles (Tensor Processing Units) sont des puces spécialisées développées par Google pour accélérer les charges de travail d'apprentissage automatique. Contrairement aux processeurs (CPU) à usage général, voire aux GPU, optimisés pour le traitement parallèle, initialement destinés aux graphiques, les TPU sont optimisés pour les opérations matricielles et tensorielles au cœur des réseaux neuronaux. Historiquement, Google a proposé différentes versions de TPU, distinguant souvent la série « e » (axée sur l'efficacité et l'inférence, exécutant des modèles pré-entraînés) et la série « p » (axée sur les performances brutes pour l'entraînement de modèles volumineux).
Présentation d'Ironwood
La nouvelle TPU Ironwood est l'accélérateur d'IA le plus ambitieux de Google à ce jour. C'est la première TPU de l'entreprise spécifiquement conçue pour répondre aux exigences des « modèles de raisonnement » à forte composante d'inférence. Ironwood apporte des améliorations substantielles à tous les indicateurs de performance clés par rapport à ses prédécesseurs, notamment :
| TPU v5e | TPU v5p | TPU v6e | TPU v7e | |
| Calcul BF16 | TFLOP 197 | TFLOP 459 | TFLOP 918 | 2.3 PFLOP* |
| Calcul INT8/FP8 | 394 TOP/TFLOP* | 918 TOP/TFLOP* | 1836 TOP/TFLOP | 4.6 POP/PFLOP |
| Bande passante HBM | 0.8 TB / s | 2.8 TB / s | 1.6 TB / s | 7.4 TB / s |
| Capacité HBM | 16 GB | 95 GB | 32 GB | 192 GB |
| Bande passante d'interconnexion inter-puces (par liaison) | 400 Gbps | 800 Gbps | 800 Gbps | 1200 Gbps |
| Topologie d'interconnexion | Tore 2D | Tore 3D | Tore 2D | Tore 3D |
| Taille du pod TPU | 256 | 8960 | 256 | 9216 |
| Noyaux de rechange | Non | Non | Oui | Oui |
Remarque : les nombres marqués d’un « * » sont des nombres calculés non officiels.
Plus particulièrement, Ironwood présente :
- Puissance de calcul massive : chaque puce offre 4.6 pétaFLOPS de performances FP8, ce qui la place dans la même classe de performances que le Blackwell B200 de NVIDIA
- Capacité de mémoire accrue : 192 Go de mémoire à large bande passante (HBM) par puce
- Bande passante mémoire considérablement améliorée : 7.37 To/s par puce, soit 4.5 fois plus que Trillium, permettant un accès plus rapide aux données pour l'inférence IA à mémoire limitée
- Capacités d'interconnexion améliorées : bande passante bidirectionnelle de 1.2 To/s, soit une amélioration de 1.5 fois par rapport à Trillium, facilitant une communication plus efficace entre les puces
Spéculations : Ironwood est-il le v6p manquant ?
Il est intéressant de noter que Google semble avoir ignoré la génération TPU v6p attendue et lancé directement la v7e Ironwood. Cela suggère que cette puce était peut-être initialement destinée à servir de puce d'entraînement v6p. Cependant, en raison de l'expansion rapide des tailles des modèles et de la nécessité de concurrencer des offres comme le GB200 NVL72 de NVIDIA, Google l'a probablement repositionnée sous le nom de v7e Ironwood. La taille imposante du module TPU 9216 et l'utilisation de l'interconnexion 3D Torus dans ce qui est désigné comme une puce de la série « e » (généralement la variante la plus économique) étayent fortement cette théorie.
La route à suivre
Google a annoncé que les TPU Ironwood seront disponibles plus tard cette année via Google Cloud. Cette technologie équipe déjà certains des systèmes d'IA les plus avancés de Google, notamment Gemini 2.5 et AlphaFold.
À mesure que ces nouveaux accélérateurs puissants seront mis à la disposition des développeurs et des chercheurs, ils permettront probablement des avancées dans les capacités de l’IA, en particulier pour les charges de travail d’inférence à grande échelle qui nécessitent à la fois une puissance de calcul massive et des capacités de raisonnement sophistiquées.




Amazon