AP49 · L’agent juge son propre travail

Famille : Vérification et évaluation

Preuve forte

Noms d'origine : self-evaluation, self-evaluation leniency, self-preference bias

Le même agent produit et note : il trouve presque toujours son travail bon.

Définition

On demande à l’agent qui a produit un livrable de dire s’il est bon, avec le même modèle et souvent dans le même contexte. Son avis sert ensuite de critère de fin ou de contrôle qualité.

Symptômes observables

  • Les auto-évaluations sont presque toujours positives.
  • Les justifications sont génériques et ne citent ni test ni preuve.
  • Un humain trouve plus tard des défauts évidents : la note de l’agent et la revue humaine divergent.

Pourquoi c'est nuisible

Le juge partage les angles morts du producteur et préfère les textes qu’il reconnaît comme les siens. Dans le même contexte, il hérite en plus de son raisonnement et de ses choix : il n’a aucun recul.

Un choix défendable quand…

  • Une relecture de forme sur un brouillon, quand un oracle déterministe ou un humain valide ensuite le fond.

Chiffres

  • Plus un modèle sait reconnaître ses propres textes, plus il les préfère quand il juge : la corrélation est linéaire (Panickssery, Bowman et Feng, 2024).
  • Anthropic observe que les agents vantent leur travail avec assurance même quand la qualité est manifestement médiocre, et qu’il est bien plus faisable de régler un évaluateur séparé pour qu’il soit sceptique (constat de l’éditeur, 2026).
  • Le remède a un prix : dans la même expérience, une exécution seule prend 20 minutes pour 9 $, le harnais complet avec évaluateur séparé 6 heures pour 200 $.

Remèdes du catalogue

Mesures hors catalogue

  • Un évaluateur d’une autre famille de modèles.
  • Des critères binaires plutôt qu’une note de 1 à 5.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns