AP51 · Tests verts comme seul critère de fin
Famille : Vérification et évaluation
Preuve moyenne
Noms d'origine : tests as the sole oracle
La batterie de tests passe, donc c’est fini : sauf que la revue refuse la PR.
Définition
On tient la tâche pour réussie dès que les tests automatisés passent, sans revue de la qualité, de la couverture ni du respect des conventions.
Symptômes observables
- Des PR au vert, refusées en revue.
- Les tests ajoutés par l’agent couvrent peu.
- Un écart durable entre le taux de réussite automatique et le taux d’acceptation humain.
Pourquoi c'est nuisible
Les tests ne capturent qu’une partie de l’intention. Un agent qui vise le vert ignore le reste : documentation, lisibilité, couverture.
Chiffres
- METR (2025) : Claude 3.7 Sonnet obtient 38 % au score fondé sur les tests, mais aucune des 15 PR relues n’est fusionnable en l’état ; celles qui passent les tests demanderaient en moyenne 26 minutes de reprise. Échantillon réduit.
- Dans la même étude, la couverture de tests est insuffisante dans toutes les exécutions qui passent les tests.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Un évaluateur applique une grille de revue (couverture, documentation, conventions) en plus des tests.
- F1 · Humain dans la boucle — Une revue humaine avant la fusion, et le taux d’acceptation humain mesuré dans l’évaluation.
- F2 · Garde-fous en couches — Lint et formatage déterministes tournent dans la boucle de l’agent.
Patterns détournés
Anti-patterns voisins
Sources
- Research Update: Algorithmic vs. Holistic Evaluation — METR (D. Rein), 2025-08-13
Contenu relu le 2026-10-05