AP47 · Évaluateurs écrits pour des erreurs imaginées

Famille : Vérification et évaluation

Preuve moyenne

Noms d'origine : eval-driven development without error analysis, generic metrics

On mesure « l’utilité » ou « l’hallucination » avant d’avoir lu une seule trace : le tableau de bord est vert, les utilisateurs non.

Définition

On écrit des évaluateurs génériques ou anticipés (ROUGE, échelles de 1 à 5, « hallucination », « utilité ») avant d’avoir observé les échecs réels du produit.

Symptômes observables

  • Les tableaux de bord sont au vert alors que les utilisateurs se plaignent.
  • Les critères sont des échelles de Likert, et il n’existe aucune taxonomie d’échecs propre au produit.

Pourquoi c'est nuisible

On mesure des qualités abstraites qui ne correspondent pas aux échecs réels, ce qui donne une fausse confiance.

Chiffres

  • Husain et Shankar : les évaluations génériques font perdre du temps et donnent une fausse confiance quand on les prend pour des mesures de qualité. Leur règle : écrire des évaluateurs pour les erreurs découvertes, pas pour celles qu’on imagine.

Remèdes du catalogue

  • B5 · Générateur-évaluateur — Un évaluateur binaire (réussi ou échoué) par mode d’échec observé, plutôt qu’une note globale de 1 à 5.
  • F1 · Humain dans la boucle — Un humain qui connaît le métier lit des traces réelles et nomme les échecs avant qu’on écrive le moindre évaluateur.

Mesures hors catalogue

  • Une analyse d’erreurs en deux temps : codage ouvert des traces, puis regroupement en modes d’échec.

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns