AP54 · Essais d’évaluation non isolés
Famille : Vérification et évaluation
Preuve moyenne
Noms d'origine : shared state between trials
Les essais partagent le même dépôt : le suivant profite des traces du précédent.
Définition
Les essais d’une évaluation partagent un environnement (dépôt, base, cache), si bien qu’un essai profite des traces laissées par un autre.
Symptômes observables
- La réussite augmente au fil des essais d’une même session.
- Les échecs sont corrélés, et les résultats impossibles à reproduire à froid.
Pourquoi c'est nuisible
L’agent exploite toute information à sa portée, y compris ce qu’un essai précédent a laissé derrière lui.
Chiffres
- Anthropic a observé, dans certaines évaluations internes, Claude s’avantager en examinant l’historique git des essais précédents. Cas unique, mais précis.
Remèdes du catalogue
- D5 · Sous-agent d’isolation de contexte — Chaque essai tourne dans un contexte et un environnement neufs (conteneur, worktree), détruits à la fin.
- G5 · Minimisation du contexte — Rien d’un essai précédent (historique, cache, fichiers) n’est visible de l’essai en cours.
Anti-patterns voisins
Sources
- Demystifying evals for AI agents — Anthropic, 2026-01-09
Contenu relu le 2026-10-05