Azure Front Door : des métadonnées incompatibles plantent le réseau de périphérie pendant plus de huit heures

2025-10-29 · Éditeur : Microsoft · Domaine : Cloud & DevOps

Le 29 octobre 2025, des changements de configuration clients génèrent des métadonnées incompatibles qui révèlent un bogue dans Azure Front Door. Portail Azure, Microsoft 365 et de nombreux services sont touchés environ 8 h 30.

Ce qui change

  • Du 29 octobre 15 h 41 UTC au 30 octobre 00 h 05 UTC : environ 8 h 30 d'incident.
  • Cause : métadonnées incompatibles entre deux versions du plan de contrôle, qui ont déclenché un bogue latent du plan de données.
  • Portail Azure, SQL Database, App Service, Microsoft 365, Dynamics 365 et Copilot touchés.
  • Reprise par suppression manuelle des configurations corrompues, puis rééquilibrage progressif du trafic.

### Ce qui change Le 29 octobre 2025, de 15 h 41 UTC jusqu'à 00 h 05 UTC le 30 octobre (environ **8 h 30**), **Azure Front Door** (AFD), le service mondial de distribution et d'équilibrage de charge en périphérie de Microsoft, connaît une défaillance majeure. Le compte rendu post-incident (PIR) de Microsoft l'explique ainsi : une suite de **changements de configuration de clients**, traités par deux versions différentes du plan de contrôle, a généré des **métadonnées incompatibles**. Elles ont révélé un **bogue latent dans le plan de données**, qui plantait lors d'un traitement asynchrone. Le défaut n'avait pas été détecté car toutes les fonctions ne sont pas validées entre versions du plan de contrôle. ### Caractéristiques - Services touchés : portail Azure, SQL Database, App Service, Active Directory B2C, mais aussi Microsoft 365, Dynamics 365, Copilot et le support client ; les clients voyaient des erreurs de délai d'attente et de résolution DNS. - Le système de protection des configurations a bloqué les nouveaux déploiements à 15 h 43 UTC ; les changements fautifs ont été identifiés à 16 h 15. - Suppression manuelle des configurations corrompues de l'instantané « dernière configuration valide » à partir de 17 h 10, déploiement de la configuration corrigée à partir de 17 h 40. - Reprise progressive avec rééquilibrage du trafic, terminée à 00 h 05 UTC le 30 octobre. ### Pourquoi c'est important Une nouvelle panne majeure d'un service mondial, moins de dix jours après celle d'AWS, rappelle que les points d'entrée communs sont des dépendances critiques, y compris pour les services de Microsoft eux-mêmes. Pour les DSI : prévoir un contournement du service de périphérie (accès direct à l'origine, DNS de repli), et inclure les services d'identité et de portail dans les scénarios de crise. ### À retenir Le point d'entrée mondial d'Azure est tombé sur un défaut de compatibilité entre versions de son propre plan de contrôle.

Liens

Tags : Incident, Azure, Edge, Hyperscaler