AP53 · Tâche d’évaluation cassée, correcteur rigide

Famille : Vérification et évaluation

Preuve forte

Noms d'origine : broken tasks, brittle graders

Le score mesure le correcteur, pas l’agent : un arrondi suffit à transformer une bonne réponse en échec.

Définition

Des énoncés ambigus, des attentes impossibles à reproduire ou un correcteur trop strict sanctionnent des réponses justes.

Symptômes observables

  • Un modèle de pointe obtient 0 % de réussite sur 100 essais.
  • Des échecs tiennent à des différences d’arrondi ou de format.
  • Le correcteur impose un chemin précis plutôt que de juger le résultat.

Pourquoi c'est nuisible

On mesure le correcteur et non l’agent, et les décisions d’architecture se fondent sur un faux signal.

Chiffres

  • Claude Opus 4.5 obtenait d’abord 42 % sur CORE-Bench, jusqu’à ce qu’un chercheur d’Anthropic trouve un correcteur rigide (« 96.12 » refusé quand « 96.124991… » était attendu), des énoncés ambigus et des tâches stochastiques impossibles à reproduire. Score après correction : 95 %.
  • Selon Anthropic, 0 % de réussite sur de nombreux essais signale le plus souvent une tâche cassée, pas un agent incapable.

Remèdes du catalogue

Mesures hors catalogue

  • Traiter un 0 % persistant comme un défaut du jeu d’évaluation à instruire avant de conclure sur l’agent.

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns