AP46 · Pas d’évaluation, seulement des correctifs

Famille : Vérification et évaluation

Preuve moyenne

Noms d'origine : no evals, reactive loops, flying blind

Chaque plainte donne lieu à un correctif, et personne ne sait si l’agent progresse ou régresse.

Définition

L’agent évolue au gré des plaintes, corrigées une à une, sans jeu d’évaluation. Les changements de prompt, d’outil ou de modèle partent en production sans mesure avant et après.

Symptômes observables

  • Chaque correction en casse une autre.
  • Personne ne peut dire si un nouveau modèle fait mieux ou moins bien que l’ancien.
  • Les décisions, comme changer de modèle ou donner plus d’autonomie, se prennent sans données.

Pourquoi c'est nuisible

Sans référence, on ne distingue pas une vraie régression du bruit. Chaque correctif local déplace le problème ailleurs. Les patterns qui reposent sur une mesure, comme l’évaluateur ou la cascade de modèles, deviennent inapplicables.

Un choix défendable quand…

  • Un prototype jetable, le temps de découvrir les premiers modes d’échec qui fourniront les premières tâches d’évaluation.

Chiffres

  • Selon Anthropic, les équipes sans évaluations s’enlisent dans des boucles réactives : elles corrigent un échec, en créent un autre, et ne distinguent plus les vraies régressions du bruit. Point de départ conseillé : 20 à 50 tâches simples tirées d’échecs réels.

Remèdes du catalogue

Mesures hors catalogue

  • Un jeu de 20 à 50 tâches tirées d’échecs réels, enrichi à chaque incident.
  • Des évaluations de non-régression bloquantes en intégration continue.
  • Une analyse d’erreurs sur des traces réelles avant d’écrire les évaluateurs.

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns