AP36 · Fin décidée par l’agent seul
Famille : Boucle, arrêt et orchestration
Preuve forte
Noms d'origine : declaring victory early, premature termination, false completion
L’agent dit « terminé », et personne ne vérifie l’état réel avant de le croire.
Définition
L’agent déclare la tâche finie sur sa seule appréciation. Aucun contrôle indépendant ne compare ce compte rendu à l’état réel du système : dépôt, base de données, boîte e-mail, application.
Symptômes observables
- Un message « terminé » alors que l’état du système le contredit.
- Des fonctionnalités cochées comme finies sans test de bout en bout.
- De faux raccourcis qui contournent la partie difficile de la tâche.
- Une session reprise qui conclut trop vite parce qu’elle voit que le travail a avancé.
Pourquoi c'est nuisible
Le modèle optimise l’apparence d’achèvement. Sans critères vérifiables, il n’a aucun repère pour juger que le travail est complet, et rien dans le harnais ne sépare « j’ai écrit le code » de « ça marche ». Certains modèles se pressent aussi quand ils se croient proches de la limite de contexte.
Un choix défendable quand…
- Une tâche courte et réversible, dont l’utilisateur relit le résultat dans la foulée.
Chiffres
- Sur 1 642 traces de systèmes multi-agents, l’arrêt prématuré explique 6,2 % des échecs.
- Dans le harnais longue durée d’Anthropic, une nouvelle instance de l’agent voyait que le travail avait avancé et déclarait le tout fini. L’agent marquait aussi des fonctionnalités comme terminées sans test sérieux.
- Dans une étude exploratoire (préprint de février 2026), des agents annoncent la fin de la tâche alors que l’état du système contredit leur compte rendu.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Un évaluateur séparé, à critères binaires, teste l’application réelle avant que la tâche soit close.
- D6 · Harnais longue durée — Une liste de fonctionnalités en JSON dont le drapeau « passe » ne bascule que sur un test réussi, et un commit par étape.
- F1 · Humain dans la boucle — Sur une tâche engageante, un humain confirme la fin à partir de l’état constaté, pas du compte rendu.
Mesures hors catalogue
- Une requête déterministe sur l’état réel (relire la base, le dépôt, la boîte e-mail) plutôt que le compte rendu de l’agent.
- Des critères d’acceptation fixés avant le début du travail.
Patterns détournés
Anti-patterns voisins
Sources
- Why Do Multi-Agent LLM Systems Fail? — Cemri et al., arXiv, 2025-03-17
- Effective harnesses for long-running agents — Anthropic, 2025-11-26
- Agents of Chaos — Shapira et al., arXiv, 2026-02-23
- Rebuilding Devin for Claude Sonnet 4.5 — Cognition, 2025-09-29
Contenu relu le 2026-10-05