AP47 · Évaluateurs écrits pour des erreurs imaginées
Famille : Vérification et évaluation
Preuve moyenne
Noms d'origine : eval-driven development without error analysis, generic metrics
On mesure « l’utilité » ou « l’hallucination » avant d’avoir lu une seule trace : le tableau de bord est vert, les utilisateurs non.
Définition
On écrit des évaluateurs génériques ou anticipés (ROUGE, échelles de 1 à 5, « hallucination », « utilité ») avant d’avoir observé les échecs réels du produit.
Symptômes observables
- Les tableaux de bord sont au vert alors que les utilisateurs se plaignent.
- Les critères sont des échelles de Likert, et il n’existe aucune taxonomie d’échecs propre au produit.
Pourquoi c'est nuisible
On mesure des qualités abstraites qui ne correspondent pas aux échecs réels, ce qui donne une fausse confiance.
Chiffres
- Husain et Shankar : les évaluations génériques font perdre du temps et donnent une fausse confiance quand on les prend pour des mesures de qualité. Leur règle : écrire des évaluateurs pour les erreurs découvertes, pas pour celles qu’on imagine.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Un évaluateur binaire (réussi ou échoué) par mode d’échec observé, plutôt qu’une note globale de 1 à 5.
- F1 · Humain dans la boucle — Un humain qui connaît le métier lit des traces réelles et nomme les échecs avant qu’on écrive le moindre évaluateur.
Mesures hors catalogue
- Une analyse d’erreurs en deux temps : codage ouvert des traces, puis regroupement en modes d’échec.
Anti-patterns voisins
Sources
- AI Evals: Everything You Need to Know — H. Husain et S. Shankar, 2026-09-18
Contenu relu le 2026-10-05