AP08 · Autonomie totale sur la foi d’une démo
Famille : Cadrage et choix du niveau
Preuve moyenne
Noms d'origine : demo-driven autonomy
Une démonstration réussie suffit à lancer l’agent en exécution autonome, sans palier intermédiaire.
Définition
La décision de produit se fonde sur une démonstration réussie : on vise d’emblée l’agent autonome, sans palier d’autonomie partielle ni mode « proposition ».
Symptômes observables
- Pas de mode « proposition » ou « planification seule » avant le mode « exécution ».
- Une évaluation sur quelques scénarios choisis à la main.
- Un taux de réussite publié sans intervalle ni volume.
Pourquoi c'est nuisible
Une démo prouve que l’agent réussit au moins une fois ; la production exige qu’il réussisse presque à chaque fois. Karpathy le résume ainsi : une démo, c’est « ça marche une fois », un produit, « ça marche à chaque fois ». L’écart se creuse à mesure que les tâches s’allongent.
Chiffres
- Sur τ-bench, gpt-4o réussit moins de 50 % des tâches ; dans le domaine commerce, moins de 25 % quand il doit réussir 8 essais consécutifs (pass^8).
- Un DSI interrogé par MIT NANDA dit avoir vu des dizaines de démos dans l’année, dont « une ou deux » vraiment utiles.
Remèdes du catalogue
- F1 · Humain dans la boucle — L’agent propose, un humain valide avant l’exécution ; l’autonomie ne s’élargit qu’au vu des taux de réussite mesurés.
- G2 · Plan figé avant contact — Un mode « planification seule » : l’agent rend un plan, relu et figé avant toute exécution.
- B5 · Générateur-évaluateur — Un évaluateur séparé vérifie les résultats sur des tâches réelles, et pas seulement sur les scénarios de la démo.
Mesures hors catalogue
- Un mode « suggestion » en production avant le mode « exécution ».
- Mesurer la fiabilité sur plusieurs essais consécutifs (pass^k) plutôt que sur une seule réussite.
Patterns détournés
Anti-patterns voisins
Sources
- Andrej Karpathy on Software 3.0: Software in the Age of AI — Latent Space (S. Wang, transcription de la conférence), 2025-06-17
- τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains — Yao, Shinn, Razavi et Narasimhan, arXiv, 2024-06-17
- The GenAI Divide: State of AI in Business 2025 — MIT NANDA (Challapally, Pease, Raskar et Chari), 2025-07
Contenu relu le 2026-10-05