Microsoft dévoile Maia 200, son accélérateur d'inférence en 3 nm

2026-01-26 · Éditeur : Microsoft · Domaine : Cloud & DevOps

Microsoft présente Maia 200, un accélérateur d'IA pour l'inférence gravé en 3 nm, avec 216 Go de HBM3e. Il est déjà déployé dans la région US Central d'Azure, et Microsoft annonce 30 % de rapport performance-prix en plus.

Ce qui change

  • Maia 200 est un accélérateur d'inférence en 3 nm avec 216 Go de HBM3e et 272 Mo de SRAM.
  • Plus de 10 pétaflops FP4 et plus de 5 pétaflops FP8, pour 750 W.
  • Déployé dans la région Azure US Central ; US West 3 est la suivante.
  • Microsoft annonce 30 % de rapport performance-prix en plus (comparaison de l'éditeur).

### Ce qui change Le 26 janvier 2026, Microsoft annonce Maia 200, un accélérateur d'IA conçu pour l'inférence, c'est-à-dire pour produire des réponses avec des modèles déjà entraînés. Il est fabriqué par TSMC en 3 nm. Microsoft indique que Maia 200 est déjà déployé dans le datacenter Azure US Central, près de Des Moines (Iowa), et que la région US West 3, près de Phoenix (Arizona), suivra. ### Caractéristiques - Mémoire : 216 Go de HBM3e à 7 To/s et 272 Mo de SRAM sur la puce. - Calcul : plus de 10 pétaflops en FP4 et plus de 5 pétaflops en FP8, pour une enveloppe de 750 W. - Microsoft annonce 30 % de rapport performance-prix en plus que le matériel le plus récent de son parc, et une performance FP4 trois fois supérieure à celle de la troisième génération d'Amazon Trainium, avec une performance FP8 au-dessus du TPU de septième génération de Google (comparaisons de l'éditeur). - Réseau : Ethernet standard avec une couche de transport sur mesure, 2,8 To/s de bande passante bidirectionnelle dédiée à l'extension, jusqu'à 6 144 accélérateurs par ensemble. - Charges visées : Microsoft Foundry, Microsoft 365 Copilot, les modèles GPT-5.2 d'OpenAI, et l'équipe Microsoft Superintelligence. - Un kit de développement en préversion inclut le compilateur Triton et la prise en charge de PyTorch. ### Pourquoi c'est important Les trois grands clouds disposent désormais d'une puce d'IA maison en production : Trainium chez AWS, TPU chez Google, Maia chez Microsoft. Pour les clients d'Azure, l'intérêt est indirect : Maia sert surtout les services de Microsoft et d'OpenAI, et le coût d'inférence qu'il baisse peut se refléter dans les prix des services d'IA. ### À retenir Maia 200 est en production : Microsoft réduit sa dépendance aux GPU pour servir ses modèles.

Liens

Tags : Azure, Puces, Hyperscaler, IA