Google Cloud Next 2026 : TPU 8t et 8i, la huitième génération se divise en deux puces
2026-04-22 · Éditeur : Google Cloud · Domaine : Cloud & DevOps
À Google Cloud Next 2026, Google annonce la huitième génération de TPU, pour la première fois en deux puces : TPU 8t pour l'entraînement (121 exaflops par superpod) et TPU 8i pour l'inférence, avec 80 % de rapport performance-prix en plus.
Ce qui change
- La huitième génération de TPU se divise en TPU 8t (entraînement) et TPU 8i (inférence).
- Un superpod TPU 8t compte 9 600 puces et 121 exaflops ; le réseau Virgo relie plus d'un million de TPU.
- TPU 8i : 384 Mo de SRAM, 288 Go de HBM et 80 % de rapport performance-prix en plus (chiffre de l'éditeur).
- Instances A5X avec NVIDIA Vera Rubin NVL72 attendues plus tard en 2026.
### Ce qui change Le 22 avril 2026, à Google Cloud Next, Google annonce la huitième génération de ses TPU, qui comprend pour la première fois deux puces et deux systèmes distincts, conçus pour l'ère des agents d'IA. Le TPU 8t cible l'entraînement ; le TPU 8i cible l'inférence et l'apprentissage par renforcement. Les deux seront proposés aux clients du cloud prochainement, selon Google. ### Caractéristiques - TPU 8t : près de 3 fois la puissance de calcul des générations précédentes ; 9 600 puces par superpod, soit 121 exaflops et 2 pétaoctets de mémoire partagée ; jusqu'à plus d'un million de puces dans un même cluster. - TPU 8i : SRAM triplée à 384 Mo, mémoire HBM à 288 Go, bande passante d'interconnexion doublée à 19,2 Tbit/s, et un moteur d'accélération des communications collectives ; 80 % de rapport performance-prix en plus pour l'inférence par rapport à la génération précédente (chiffres de l'éditeur). - Réseau Virgo : jusqu'à 134 000 TPU dans une même infrastructure sur un site, et plus d'un million sur plusieurs sites. - Instances A5X avec NVIDIA Vera Rubin NVL72, attendues plus tard en 2026, et VM Axion N4A pour les charges d'agents. - Stockage : Managed Lustre atteint 10 To/s de bande passante (10 fois plus qu'un an plus tôt) et 80 pétaoctets de capacité. ### Pourquoi c'est important Google sépare désormais les puces d'entraînement et d'inférence, ce qui reflète la différence de besoins entre les deux usages. Pour les équipes d'architecture, le choix entre TPU et GPU se précise : Google propose les deux, avec une montée en charge à l'échelle du million de puces. Les performances annoncées sont celles de l'éditeur, et les tarifs ne sont pas encore connus. ### À retenir La huitième génération de TPU spécialise l'entraînement et l'inférence : le silicium d'IA se segmente.
Liens
Tags : Google Cloud, Puces, Hyperscaler, IA, Conférence