Panne Google Cloud : une erreur dans Service Control fait tomber plus de 50 services

2025-06-12 · Éditeur : Google Cloud · Domaine : Cloud & DevOps

Le 12 juin 2025, une politique de quotas défectueuse plante Service Control, la brique d'API de Google Cloud, dans toutes les régions. Plus de 50 produits renvoient des erreurs 503 pendant environ trois heures.

Ce qui change

  • Panne mondiale du 12 juin 2025, de 10 h 49 à environ 13 h 49 (heure du Pacifique).
  • Une politique de quotas invalide a déclenché un pointeur nul dans Service Control, en boucle de plantage.
  • Plus de 50 produits en erreur 503, dont BigQuery, Cloud Run et Workspace.
  • Cloudflare, dont Workers KV dépend d'un fournisseur tiers, a aussi été touché pendant 2 h 28.

### Ce qui change Le 12 juin 2025, de 10 h 49 à environ 13 h 49 (heure du Pacifique), **Google Cloud** subit une panne mondiale. Selon son rapport d'incident, une nouvelle fonction de politique de quotas ajoutée à **Service Control** (la brique qui vérifie les autorisations et quotas des appels d'API) n'avait ni gestion d'erreur adaptée ni protection par drapeau de fonctionnalité. Une mise à jour de quotas invalide, propagée à l'échelle mondiale, contenait des champs vides ; ils ont exécuté un chemin de code qui a déclenché un déréférencement de pointeur nul, et les binaires sont entrés en boucle de plantage. ### Caractéristiques - Plus de 50 produits renvoient des erreurs 503, dont BigQuery, Compute Engine, Cloud Storage, Cloud Run, IAM et des services Google Workspace (Gmail, Drive, Docs, Meet, Calendar). - Un « bouton rouge » désactivant le chemin fautif a été activé environ 40 minutes après le début, lançant la reprise dans la plupart des régions ; us-central1 a connu une reprise plus longue. - Google s'engage à modulariser Service Control, à imposer des drapeaux de fonctionnalité sur les binaires critiques, à améliorer la gestion d'erreur, à introduire un recul exponentiel et à mieux communiquer. - Cloudflare a subi le même jour une panne de 2 h 28 : son service Workers KV s'appuie en partie sur un fournisseur cloud tiers, dont la panne l'a directement touché (Cloudflare ne cite pas Google dans son billet). ### Pourquoi c'est important La panne montre qu'une dépendance transverse (ici, les contrôles d'API) casse toutes les régions à la fois : la redondance géographique ne protège pas d'un défaut de logiciel global. Pour les DSI, c'est aussi un rappel de la chaîne de dépendances : un service tiers qui repose sur un hyperscaler tombe avec lui. Cartographier ces dépendances fait partie du plan de continuité. ### À retenir Un changement de configuration globale a cassé le plan de contrôle d'un hyperscaler, et des services tiers avec lui.

Liens

Tags : Incident, Google Cloud, Hyperscaler, Cloud