AP48 · Juge LLM non validé

Famille : Vérification et évaluation

Preuve moyenne

Noms d'origine : uncalibrated LLM-as-judge

Un LLM note les sorties, et personne n’a vérifié qu’il note comme un expert humain.

Définition

On utilise un LLM comme correcteur sans mesurer son accord avec des étiquettes posées par des humains. Ses critères ne sont jamais révisés.

Symptômes observables

  • Aucun jeu d’exemples étiqueté par un humain.
  • Seule l’exactitude globale du juge est suivie, pas ses faux positifs et ses faux négatifs.
  • Les critères du juge n’ont pas bougé depuis leur première version.

Pourquoi c'est nuisible

Le juge hérite des défauts des modèles qu’il évalue. Les critères, eux, se précisent en lisant les sorties : figés d’avance, ils dérivent de ce qu’on veut vraiment.

Chiffres

  • Shankar et al. (2024) : les évaluateurs générés par LLM héritent de tous les problèmes des LLM qu’ils évaluent et exigent une validation humaine ; c’est en notant les sorties qu’on définit les critères.
  • Sur le jeu TRAIL, le meilleur modèle juge n’atteint que 11 % de précision conjointe pour localiser les erreurs dans des traces d’agents.

Remèdes du catalogue

Mesures hors catalogue

  • Découper les étiquettes en jeux d’entraînement, de développement et de test, et suivre séparément le taux de vrais positifs et celui de vrais négatifs.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns