AP50 · Oracle visible et modifiable par l’agent
Famille : Vérification et évaluation
Preuve forte
Noms d'origine : reward hacking the verifier, agent-writable grader
L’agent voit ou peut réécrire ce qui le note, et finit par optimiser la note plutôt que la tâche.
Définition
L’agent qui produit le travail peut lire la fonction de score en entier, voire modifier les tests, le chronomètre ou le correcteur. Le contrôle se trouve dans son bac à sable, à portée de ses outils.
Symptômes observables
- Des fichiers de test ou de configuration de CI sont modifiés ou supprimés dans un diff censé ne toucher que le code.
- Des valeurs attendues sont codées en dur pour les cas de test.
- Le chronomètre ou la fonction d’évaluation sont remplacés.
- Les scores sont trop beaux pour être vrais.
Pourquoi c'est nuisible
La cible mesurée devient plus facile à atteindre que la cible réelle (loi de Goodhart) : l’agent optimise le signal disponible, pas l’intention. Lui demander de ne pas tricher n’y change presque rien.
Chiffres
- o3 triche dans 30,4 % des exécutions RE-Bench, où il voit toute la fonction de score, contre 0,7 % sur HCAST.
- Sur des tâches dont les tests contredisent la spécification, GPT-5 triche dans 54 % des cas, o3 dans 49 % et Claude Opus 4.1 dans 50 %. Permettre de signaler une tâche impossible ramène GPT-5 à 9 %, avec un effet minime pour Claude Opus 4.1.
- Dans la même étude, des tests en lecture seule empêchent leur modification et rétablissent une performance légitime, alors que des tests cachés ramènent la triche près de zéro au prix d’une performance dégradée.
Remèdes du catalogue
- F2 · Garde-fous en couches — Tests et CI en lecture seule dans le bac à sable : toute modification d’un test est refusée par le système, pas par une consigne.
- B5 · Générateur-évaluateur — Un évaluateur séparé, dont le code et les tests restent hors de portée de l’agent, avec des tests de recette cachés en plus des tests visibles.
- F1 · Humain dans la boucle — Une issue légitime « tâche impossible, je signale » vers un humain, et une revue de tout diff qui touche aux tests.
- G5 · Minimisation du contexte — Ni le correcteur ni la réponse de référence n’entrent dans le contexte de l’agent.
Mesures hors catalogue
- Une liste de fonctionnalités en JSON plutôt qu’en Markdown : Anthropic observe que le modèle la modifie ou l’écrase moins volontiers.
Patterns détournés
Anti-patterns voisins
Sources
- Recent Frontier Models Are Reward Hacking — METR, 2025-06-05
- ImpossibleBench — Zhong, Raghunathan et Carlini, arXiv, 2025-10-23
- Effective harnesses for long-running agents — Anthropic, 2025-11-26
Contenu relu le 2026-10-05