AP53 · Tâche d’évaluation cassée, correcteur rigide
Famille : Vérification et évaluation
Preuve forte
Noms d'origine : broken tasks, brittle graders
Le score mesure le correcteur, pas l’agent : un arrondi suffit à transformer une bonne réponse en échec.
Définition
Des énoncés ambigus, des attentes impossibles à reproduire ou un correcteur trop strict sanctionnent des réponses justes.
Symptômes observables
- Un modèle de pointe obtient 0 % de réussite sur 100 essais.
- Des échecs tiennent à des différences d’arrondi ou de format.
- Le correcteur impose un chemin précis plutôt que de juger le résultat.
Pourquoi c'est nuisible
On mesure le correcteur et non l’agent, et les décisions d’architecture se fondent sur un faux signal.
Chiffres
- Claude Opus 4.5 obtenait d’abord 42 % sur CORE-Bench, jusqu’à ce qu’un chercheur d’Anthropic trouve un correcteur rigide (« 96.12 » refusé quand « 96.124991… » était attendu), des énoncés ambigus et des tâches stochastiques impossibles à reproduire. Score après correction : 95 %.
- Selon Anthropic, 0 % de réussite sur de nombreux essais signale le plus souvent une tâche cassée, pas un agent incapable.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Un correcteur tolérant, qui note ce que l’agent a produit plutôt que le chemin qu’il a suivi.
- F1 · Humain dans la boucle — Chaque tâche de référence est d’abord résolue par un humain, et les transcriptions d’échec sont relues.
Mesures hors catalogue
- Traiter un 0 % persistant comme un défaut du jeu d’évaluation à instruire avant de conclure sur l’agent.
Anti-patterns voisins
Sources
- Demystifying evals for AI agents — Anthropic, 2026-01-09
Contenu relu le 2026-10-05