AP48 · Juge LLM non validé
Famille : Vérification et évaluation
Preuve moyenne
Noms d'origine : uncalibrated LLM-as-judge
Un LLM note les sorties, et personne n’a vérifié qu’il note comme un expert humain.
Définition
On utilise un LLM comme correcteur sans mesurer son accord avec des étiquettes posées par des humains. Ses critères ne sont jamais révisés.
Symptômes observables
- Aucun jeu d’exemples étiqueté par un humain.
- Seule l’exactitude globale du juge est suivie, pas ses faux positifs et ses faux négatifs.
- Les critères du juge n’ont pas bougé depuis leur première version.
Pourquoi c'est nuisible
Le juge hérite des défauts des modèles qu’il évalue. Les critères, eux, se précisent en lisant les sorties : figés d’avance, ils dérivent de ce qu’on veut vraiment.
Chiffres
- Shankar et al. (2024) : les évaluateurs générés par LLM héritent de tous les problèmes des LLM qu’ils évaluent et exigent une validation humaine ; c’est en notant les sorties qu’on définit les critères.
- Sur le jeu TRAIL, le meilleur modèle juge n’atteint que 11 % de précision conjointe pour localiser les erreurs dans des traces d’agents.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Le juge est calibré sur des étiquettes humaines et revalidé à chaque changement de critère ou de modèle.
- F1 · Humain dans la boucle — Un expert du domaine étiquette un échantillon et relit les transcriptions où le juge et lui divergent.
Mesures hors catalogue
- Découper les étiquettes en jeux d’entraînement, de développement et de test, et suivre séparément le taux de vrais positifs et celui de vrais négatifs.
Patterns détournés
Anti-patterns voisins
Sources
- Who Validates the Validators? — Shankar, Zamfirescu-Pereira, Hartmann, Parameswaran et Arawjo, arXiv, 2024-04-18
- Demystifying evals for AI agents — Anthropic, 2026-01-09
- TRAIL: Trace Reasoning and Agentic Issue Localization — Deshpande et al. (Patronus AI), arXiv, 2025-05-13
- AI Evals: Everything You Need to Know — H. Husain et S. Shankar, 2026-09-18
Contenu relu le 2026-10-05