AP77 · Régressions silencieuses au changement

Famille : Supervision, exploitation et gouvernance

Preuve forte

Noms d'origine : silent regression on change, unpinned model alias

Le modèle, le prompt ou l’infrastructure change, et seuls les utilisateurs voient la qualité baisser.

Définition

Un modèle, un prompt, un outil ou l’infrastructure d’inférence change, et aucune évaluation continue ne bloque la mise en production ni ne détecte la baisse de qualité. Souvent, l’agent appelle un alias « dernière version » non figé.

Symptômes observables

  • Un identifiant de modèle sans date de version (alias) dans les traces.
  • Un prompt système sans numéro de version ni empreinte dans les spans.
  • Plus de nouvelles tentatives, ou moins d’appels d’outils réussis, juste après un changement.
  • Les plaintes des utilisateurs arrivent avant toute alerte interne.

Pourquoi c'est nuisible

Le comportement d’un « même » service de modèle change. Les évaluations génériques mesurent l’exactitude, pas le comportement. Et un agent masque une erreur isolée en se rattrapant : la dégradation devient intermittente, donc difficile à voir.

Un choix défendable quand…

  • Un usage personnel ou un prototype, où l’on veut toujours le dernier modèle et où une régression ne coûte qu’un nouvel essai.

Chiffres

  • Entre mars et juin 2023, GPT-4 est passé de 84 % à 51 % de bonnes réponses pour reconnaître les nombres premiers : le « même » service avait changé.
  • Anthropic garantit au moins 60 jours de préavis avant le retrait d’un modèle ; Claude Sonnet 4 a été retiré le 15 juin 2026, environ 13 mois après sa sortie. Il faut donc prévoir au moins une migration de modèle par an.

Incidents publics

  • 2025-08 — Anthropic Trois bogues d’infrastructure ont dégradé des réponses de Claude entre le 5 août et début septembre 2025. Le 31 août, un bogue de routage vers des serveurs à contexte long touchait jusqu’à 16 % des requêtes Sonnet 4, et environ 30 % des utilisateurs de Claude Code ont reçu au moins une réponse dégradée. Les évaluations en place ne captaient pas la dégradation signalée par les utilisateurs. Correctif annoncé : Anthropic annonce des évaluations plus sensibles et une évaluation continue sur la production.
  • 2025-04-25 — OpenAI La mise à jour de GPT-4o du 25 avril 2025 a été retirée au bout de quelques jours. Un signal de récompense fondé sur les pouces levés des utilisateurs avait affaibli le garde-fou contre la complaisance ; les évaluations hors ligne et les tests A/B étaient bons, et la complaisance n’était pas mesurée. Post-mortem d’OpenAI, lu par une copie, la page d’origine refusant l’accès. Correctif annoncé : OpenAI annonce traiter désormais les problèmes de comportement comme bloquants pour une mise en production.

Remèdes du catalogue

  • B5 · Générateur-évaluateur — Une évaluation continue, avec des cas de comportement et pas seulement d’exactitude, qui bloque la mise en production en cas de régression et tourne aussi sur la production.
  • F3 · Cascade et routage de modèles — Garder l’ancien modèle en repli et basculer le trafic progressivement, avec un retour arrière en un geste.

Mesures hors catalogue

  • Figer l’instantané daté du modèle plutôt qu’un alias, et écrire dans chaque span les versions du modèle, du prompt et des outils.
  • Relier le canal de remontée des utilisateurs aux traces.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns