Google dévoile Ironwood, son TPU de septième génération conçu pour l'inférence
2025-04-09 · Éditeur : Google Cloud · Domaine : Cloud & DevOps
À Google Cloud Next 2025, Google présente Ironwood, son TPU de septième génération, qu'il décrit comme le premier conçu pour l'inférence. Un pod de 9 216 puces atteint 42,5 exaflops, avec 192 Go de mémoire HBM par puce.
Ce qui change
- Ironwood est le TPU de septième génération de Google, présenté comme le premier conçu pour l'inférence.
- Par puce : 4 614 téraflops, 192 Go de HBM et 7,37 To/s de bande passante mémoire.
- Un pod de 9 216 puces délivre 42,5 exaflops ; une configuration de 256 puces existe aussi.
- Deux fois mieux par watt que Trillium, selon Google ; disponibilité annoncée pour plus tard en 2025.
### Ce qui change Le 9 avril 2025, à Google Cloud Next, Google présente Ironwood, son TPU (Tensor Processing Unit) de septième génération. Google le décrit comme son accélérateur d'IA le plus performant et le plus évolutif à ce jour, et comme le premier TPU conçu spécifiquement pour l'inférence, c'est-à-dire pour servir les modèles et non les entraîner. La disponibilité est annoncée pour plus tard en 2025. ### Caractéristiques - Par puce : 4 614 téraflops de calcul crête, 192 Go de mémoire HBM et 7,37 To/s de bande passante mémoire. - Interconnexion entre puces (ICI) de 1,2 Tbit/s bidirectionnel. - Deux configurations : 256 puces ou 9 216 puces ; cette dernière atteint 42,5 exaflops au total. - Efficacité annoncée : deux fois mieux par watt que Trillium (sixième génération) et près de 30 fois mieux que le premier Cloud TPU de 2018. - Capacité mémoire multipliée par 6 et bande passante mémoire par 4,5 par rapport à Trillium. - Le runtime Pathways de Google coordonne le calcul distribué sur de très grands ensembles de puces. - Précision ultérieure de Google (6 novembre 2025) : jusqu'à 10 fois la performance crête du TPU v5p et plus de 4 fois la performance par puce du TPU v6e (Trillium) pour l'entraînement et l'inférence. ### Pourquoi c'est important Le coût de l'inférence pèse de plus en plus dans les dépenses d'IA à mesure que les modèles de raisonnement se déploient. Ironwood s'attaque à ce point précis et vise à abaisser le coût par requête face aux GPU. Pour les clients, l'intérêt dépendra de la portabilité logicielle (JAX, PyTorch) et du prix réel, que Google n'a pas détaillé à l'annonce. ### À retenir Le TPU de septième génération cible l'inférence : l'accélérateur d'IA se spécialise selon l'usage.
Liens
Tags : Google Cloud, Puces, Hyperscaler, IA, Conférence