Panne AWS us-east-1 : une course critique dans le DNS de DynamoDB paralyse la région pendant 14 heures

2025-10-20 · Éditeur : AWS · Domaine : Cloud & DevOps

Dans la nuit du 19 au 20 octobre 2025, un défaut d'automatisation DNS vide l'adresse du point d'accès DynamoDB de us-east-1. EC2, Lambda, les load balancers et d'autres services sont perturbés pendant environ 14 heures 30.

Ce qui change

  • Panne du 19 au 20 octobre 2025 : environ 14 h 30 d'impact dans us-east-1.
  • Cause : une condition de concurrence entre deux composants DNS de DynamoDB, qui a effacé toutes les adresses IP du point d'accès.
  • Cascade sur EC2, Lambda, les load balancers, ECS, EKS, Redshift, STS et la console.
  • AWS désactive l'automatisation DNS de DynamoDB dans le monde, le temps des correctifs.

### Ce qui change Du 19 octobre 2025 à 23 h 48 au 20 octobre à 14 h 20 (heure du Pacifique), soit environ **14 h 30**, **AWS** subit une panne majeure dans sa région **us-east-1** (Virginie du Nord). Le compte rendu officiel en donne la cause : une **condition de concurrence latente** dans le système automatique de gestion DNS de DynamoDB. Deux composants indépendants (« DNS Enactors »), exécutés dans des zones de disponibilité différentes, se sont chevauchés : un plan DNS ancien a écrasé un plan plus récent, puis a été supprimé, ce qui a **retiré toutes les adresses IP** du point d'accès régional de DynamoDB. Une intervention manuelle a été nécessaire. ### Caractéristiques - Services touchés : DynamoDB d'abord, puis le lancement d'instances EC2, les Network Load Balancers, Lambda, ECS, EKS, Fargate, Amazon Connect, Redshift, STS et l'authentification de la console de gestion. - Trois périodes d'impact distinctes, avec des défaillances en cascade. - Mesures annoncées : désactiver l'automatisation DNS de DynamoDB dans le monde le temps des correctifs, corriger la condition de concurrence, limiter la vitesse des bascules de contrôles de santé des NLB, étendre les tests d'échelle d'EC2 et améliorer la limitation des flux de propagation. - AWS présente ses excuses aux clients dans le compte rendu. ### Pourquoi c'est important Une base de données gérée est une dépendance cachée de nombreux autres services : quand sa résolution de noms disparaît, tout ce qui l'appelle chute, y compris des outils d'administration. Pour les DSI, l'enseignement est de concevoir pour une dégradation de us-east-1 (multi-région actif, ou au moins un plan de reprise répété), de réduire les dépendances de plan de contrôle en situation de crise et de tester la perte de DNS. ### À retenir Un défaut d'automatisation a coupé l'accès à DynamoDB ; l'effet domino a été bien plus large que la base elle-même.

Liens

Tags : Incident, AWS, Hyperscaler, Cloud