Google Cloud : les TPU Trillium passent en disponibilité générale

2024-12-12 · Éditeur : Google Cloud · Domaine : Cloud & DevOps

Google Cloud ouvre à tous ses clients Trillium, son TPU de sixième génération, qui a servi à entraîner Gemini 2.0. Google annonce plus de 4 fois la performance d'entraînement et 67 % d'efficacité énergétique en plus que la génération précédente.

Ce qui change

  • Trillium (TPU de 6e génération) est en disponibilité générale ; Google l'a utilisé pour entraîner Gemini 2.0.
  • Google annonce plus de 4 fois la performance d'entraînement et 67 % d'efficacité énergétique en plus (chiffres de l'éditeur).
  • Jusqu'à 100 000 puces dans un même réseau Jupiter, à 13 Pb/s de bande passante de bisection.
  • L'AI Hypercomputer combine le matériel avec JAX, PyTorch, TensorFlow et le compilateur XLA.

### Ce qui change Le 12 décembre 2024, Google Cloud annonce la disponibilité générale de Trillium, son TPU (Tensor Processing Unit) de sixième génération, annoncé plus tôt dans l'année. Google précise avoir utilisé Trillium pour entraîner Gemini 2.0, son modèle le plus avancé du moment. Entreprises et jeunes pousses accèdent ainsi à la même infrastructure que celle de Google. ### Caractéristiques - Par rapport à la génération précédente, Google annonce : plus de 4 fois la performance d'entraînement, jusqu'à 3 fois le débit d'inférence, 67 % d'efficacité énergétique en plus, 4,7 fois la puissance de calcul crête par puce, une capacité de mémoire HBM et une bande passante d'interconnexion doublées. - Jusqu'à 100 000 puces Trillium dans un même réseau Jupiter, avec 13 pétabits par seconde de bande passante de bisection. - Trillium est un composant de l'AI Hypercomputer, l'architecture de Google qui combine matériel, logiciels ouverts (JAX, PyTorch, TensorFlow, compilateur XLA) et modes de consommation flexibles. - AI21 Labs, éditeur des modèles Jamba, est cité comme client. - Des optimisations du compilateur XLA et des frameworks, ainsi que le déport d'état vers la mémoire DRAM de l'hôte, complètent la mémoire HBM. ### Pourquoi c'est important Le choix d'un accélérateur d'IA est devenu une décision d'architecture : TPU, GPU NVIDIA ou puces maison d'autres clouds. Trillium montre que Google propose l'infrastructure qui a entraîné son propre modèle phare. Pour les clients, la portabilité logicielle (JAX, PyTorch/XLA) et la disponibilité dans la région visée comptent autant que les chiffres de performance, qui restent ceux de l'éditeur. ### À retenir Le TPU de sixième génération est ouvert à tous : Google Cloud vend ce qui a entraîné Gemini 2.0.

Liens

Tags : Google Cloud, Puces, Hyperscaler, IA