xAI : le supercalculateur Colossus, 100 000 GPU Hopper à Memphis, construit en 122 jours

2024-10-28 · Éditeur : xAI · Domaine : Cloud & DevOps

NVIDIA détaille Colossus, le cluster de 100 000 GPU Hopper construit par xAI à Memphis en 122 jours, relié en Ethernet Spectrum-X, avec un doublement à 200 000 GPU en cours.

Ce qui change

  • Colossus compte 100 000 GPU Hopper à Memphis, construits en 122 jours.
  • Le doublement à 200 000 GPU est en cours.
  • Le réseau est de l'Ethernet Spectrum-X, avec un débit maintenu de 95 % annoncé.
  • Il faut 19 jours entre le premier rack et le début de l'entraînement.

### Ce qui change Le 28 octobre 2024, NVIDIA annonce que le cluster **Colossus** d'xAI, composé de 100 000 GPU Hopper à Memphis (Tennessee), a atteint cette taille grâce à sa plateforme réseau Ethernet Spectrum-X. Le site et le supercalculateur ont été construits par xAI et NVIDIA en 122 jours, contre plusieurs mois ou années pour un système de cette taille. Colossus sert à entraîner les modèles de langage Grok. xAI est en train de doubler sa taille pour atteindre 200 000 GPU Hopper. ### Caractéristiques - Délai : 122 jours pour le site et le système, dont 19 jours entre l'arrivée du premier rack et le début de l'entraînement. - Taille : 100 000 GPU Hopper, avec un doublement à 200 000 en cours. - Réseau : Ethernet Spectrum-X avec commutateurs SN5600 (800 Gb/s) et SuperNIC BlueField-3, au lieu d'InfiniBand. - Performance annoncée : 95 % de débit de données maintenu, contre 60 % pour un Ethernet standard, sans perte de paquets liée aux collisions de flux. - Usage : entraînement de la famille de modèles Grok. ### Pourquoi c'est important Colossus fixe un nouvel étalon de vitesse de déploiement : un campus d'IA de cette taille en quatre mois, là où les projets classiques se comptent en années. Il montre aussi qu'un réseau Ethernet peut remplacer InfiniBand à très grande échelle, ce qui ouvre le marché à d'autres équipementiers. Les chiffres de débit et de délai sont ceux d'NVIDIA et d'xAI, non audités. ### À retenir La vitesse de construction devient un avantage concurrentiel du cloud d'IA, avec le réseau Ethernet comme variante à InfiniBand.

Liens

Tags : Datacenter, NVIDIA, États-Unis, Puces