AP52 · Fiabilité mesurée sur un seul essai
Famille : Vérification et évaluation
Preuve forte
Noms d'origine : pass@1 instead of pass^k, single-run, solo-mode evaluation
Réussir un essai prouve que l’agent sait faire, pas qu’il réussira à chaque fois.
Définition
On valide l’agent sur un essai par cas, ou sur le meilleur de plusieurs, avec un utilisateur passif. On le déploie ensuite là où l’utilisateur agit aussi et où chaque cas revient des milliers de fois.
Symptômes observables
- Le jeu d’évaluation ne compte qu’un essai par tâche, ou rapporte la réussite « au moins une fois sur k ».
- La démo convainc, la production est instable.
- Les résultats d’évaluation ne laissent pas prévoir le taux d’incidents en production.
- La réussite chute quand l’agent doit guider un utilisateur qui agit lui aussi.
Pourquoi c'est nuisible
La variance d’un agent est élevée et sa constance n’est pas mesurée : une démo montre que ça marche une fois, un produit doit marcher à chaque fois. La coordination avec un utilisateur actif ajoute des erreurs que l’évaluation en solo ignore.
Un choix défendable quand…
- Explorer une capacité (l’agent sait-il le faire au moins une fois ?), avant toute décision de déploiement.
Chiffres
- Dans le domaine commerce de τ-bench, gpt-4o réussit moins de 50 % des tâches, et moins de 25 % quand il doit réussir 8 essais consécutifs (pass^8).
- Avec un utilisateur actif plutôt que passif, gpt-4.1 perd 18 points et o4-mini 25 points de réussite au premier essai, dans le domaine télécom de τ²-bench.
- À k = 10, la réussite à chaque essai (pass^k) chute pendant que la réussite au moins une fois (pass@k) approche 100 % (Anthropic, 2026).
Remèdes du catalogue
- F1 · Humain dans la boucle — Les cas à faible constance passent par un humain plutôt qu’en autonomie.
- B4 · Échantillonnage et vote — Quand un vote est possible, plusieurs essais indépendants votent, ce qui réduit la variance.
- B6 · Graphe d’états sur mesure — Les parcours critiques sont fixés dans un graphe d’états plutôt que laissés à l’agent.
- F3 · Cascade et routage de modèles — Escalade vers un modèle plus capable, ou vers un humain, quand la confiance est basse.
Mesures hors catalogue
- Mesurer pass^k, réussir k fois sur k, et pas seulement le premier essai.
- Un simulateur d’utilisateur actif dans le jeu d’évaluation.
Anti-patterns voisins
Sources
- τ-bench — Yao, Shinn, Razavi et Narasimhan, arXiv, 2024-06-17
- τ²-bench — Barres et al., arXiv, 2025-06-09
- Demystifying evals for AI agents — Anthropic, 2026-01-09
Contenu relu le 2026-10-05