AP49 · L’agent juge son propre travail
Famille : Vérification et évaluation
Preuve forte
Noms d'origine : self-evaluation, self-evaluation leniency, self-preference bias
Le même agent produit et note : il trouve presque toujours son travail bon.
Définition
On demande à l’agent qui a produit un livrable de dire s’il est bon, avec le même modèle et souvent dans le même contexte. Son avis sert ensuite de critère de fin ou de contrôle qualité.
Symptômes observables
- Les auto-évaluations sont presque toujours positives.
- Les justifications sont génériques et ne citent ni test ni preuve.
- Un humain trouve plus tard des défauts évidents : la note de l’agent et la revue humaine divergent.
Pourquoi c'est nuisible
Le juge partage les angles morts du producteur et préfère les textes qu’il reconnaît comme les siens. Dans le même contexte, il hérite en plus de son raisonnement et de ses choix : il n’a aucun recul.
Un choix défendable quand…
- Une relecture de forme sur un brouillon, quand un oracle déterministe ou un humain valide ensuite le fond.
Chiffres
- Plus un modèle sait reconnaître ses propres textes, plus il les préfère quand il juge : la corrélation est linéaire (Panickssery, Bowman et Feng, 2024).
- Anthropic observe que les agents vantent leur travail avec assurance même quand la qualité est manifestement médiocre, et qu’il est bien plus faisable de régler un évaluateur séparé pour qu’il soit sceptique (constat de l’éditeur, 2026).
- Le remède a un prix : dans la même expérience, une exécution seule prend 20 minutes pour 9 $, le harnais complet avec évaluateur séparé 6 heures pour 200 $.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Un évaluateur séparé, à contexte neuf, réglé pour être sceptique et outillé pour tester le résultat réel (tests, navigateur piloté).
- D5 · Sous-agent d’isolation de contexte — L’évaluation tourne dans un sous-agent qui ne voit que le livrable et les critères, pas le raisonnement du producteur.
- F2 · Garde-fous en couches — Des contrôles déterministes (tests, linters, schémas) jugent tout ce qui peut l’être sans modèle.
- F1 · Humain dans la boucle — Un humain relit un échantillon pour vérifier que l’évaluateur reste aligné avec son jugement.
Mesures hors catalogue
- Un évaluateur d’une autre famille de modèles.
- Des critères binaires plutôt qu’une note de 1 à 5.
Patterns détournés
Anti-patterns voisins
Sources
- LLM Evaluators Recognize and Favor Their Own Generations — Panickssery, Bowman et Feng, arXiv, 2024-04-15
- Harness design for long-running application development — Anthropic, 2026-03-24
Contenu relu le 2026-10-05