AP52 · Fiabilité mesurée sur un seul essai

Famille : Vérification et évaluation

Preuve forte

Noms d'origine : pass@1 instead of pass^k, single-run, solo-mode evaluation

Réussir un essai prouve que l’agent sait faire, pas qu’il réussira à chaque fois.

Définition

On valide l’agent sur un essai par cas, ou sur le meilleur de plusieurs, avec un utilisateur passif. On le déploie ensuite là où l’utilisateur agit aussi et où chaque cas revient des milliers de fois.

Symptômes observables

  • Le jeu d’évaluation ne compte qu’un essai par tâche, ou rapporte la réussite « au moins une fois sur k ».
  • La démo convainc, la production est instable.
  • Les résultats d’évaluation ne laissent pas prévoir le taux d’incidents en production.
  • La réussite chute quand l’agent doit guider un utilisateur qui agit lui aussi.

Pourquoi c'est nuisible

La variance d’un agent est élevée et sa constance n’est pas mesurée : une démo montre que ça marche une fois, un produit doit marcher à chaque fois. La coordination avec un utilisateur actif ajoute des erreurs que l’évaluation en solo ignore.

Un choix défendable quand…

  • Explorer une capacité (l’agent sait-il le faire au moins une fois ?), avant toute décision de déploiement.

Chiffres

  • Dans le domaine commerce de τ-bench, gpt-4o réussit moins de 50 % des tâches, et moins de 25 % quand il doit réussir 8 essais consécutifs (pass^8).
  • Avec un utilisateur actif plutôt que passif, gpt-4.1 perd 18 points et o4-mini 25 points de réussite au premier essai, dans le domaine télécom de τ²-bench.
  • À k = 10, la réussite à chaque essai (pass^k) chute pendant que la réussite au moins une fois (pass@k) approche 100 % (Anthropic, 2026).

Remèdes du catalogue

Mesures hors catalogue

  • Mesurer pass^k, réussir k fois sur k, et pas seulement le premier essai.
  • Un simulateur d’utilisateur actif dans le jeu d’évaluation.

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns