AP08 · Autonomie totale sur la foi d’une démo

Famille : Cadrage et choix du niveau

Preuve moyenne

Noms d'origine : demo-driven autonomy

Une démonstration réussie suffit à lancer l’agent en exécution autonome, sans palier intermédiaire.

Définition

La décision de produit se fonde sur une démonstration réussie : on vise d’emblée l’agent autonome, sans palier d’autonomie partielle ni mode « proposition ».

Symptômes observables

  • Pas de mode « proposition » ou « planification seule » avant le mode « exécution ».
  • Une évaluation sur quelques scénarios choisis à la main.
  • Un taux de réussite publié sans intervalle ni volume.

Pourquoi c'est nuisible

Une démo prouve que l’agent réussit au moins une fois ; la production exige qu’il réussisse presque à chaque fois. Karpathy le résume ainsi : une démo, c’est « ça marche une fois », un produit, « ça marche à chaque fois ». L’écart se creuse à mesure que les tâches s’allongent.

Chiffres

  • Sur τ-bench, gpt-4o réussit moins de 50 % des tâches ; dans le domaine commerce, moins de 25 % quand il doit réussir 8 essais consécutifs (pass^8).
  • Un DSI interrogé par MIT NANDA dit avoir vu des dizaines de démos dans l’année, dont « une ou deux » vraiment utiles.

Remèdes du catalogue

  • F1 · Humain dans la boucle — L’agent propose, un humain valide avant l’exécution ; l’autonomie ne s’élargit qu’au vu des taux de réussite mesurés.
  • G2 · Plan figé avant contact — Un mode « planification seule » : l’agent rend un plan, relu et figé avant toute exécution.
  • B5 · Générateur-évaluateur — Un évaluateur séparé vérifie les résultats sur des tâches réelles, et pas seulement sur les scénarios de la démo.

Mesures hors catalogue

  • Un mode « suggestion » en production avant le mode « exécution ».
  • Mesurer la fiabilité sur plusieurs essais consécutifs (pass^k) plutôt que sur une seule réussite.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns