AP06 · Tâche plus longue que l’horizon fiable
Famille : Cadrage et choix du niveau
Preuve forte
Noms d'origine : horizon overreach, one-shotting
Une tâche de plusieurs heures confiée d’un bloc, que l’agent tente de produire d’une traite.
Définition
On confie d’un seul tenant à un agent une tâche dont la durée humaine dépasse nettement ce que le modèle réussit de façon fiable, sans découpage en étapes vérifiées ni point de reprise.
Symptômes observables
- L’agent tente tout d’un coup et épuise son contexte en pleine implémentation.
- À la reprise, le travail est à moitié fait et rien ne dit où il en est.
- Le taux de réussite s’effondre quand la tâche s’allonge.
Pourquoi c'est nuisible
Les erreurs se composent : une précision par étape un peu inférieure à 100 % rend une longue séquence très improbable. Anthropic l’a observé sur ses agents de code, qui cherchaient à produire l’application d’une traite et laissaient un travail inachevé à la session suivante.
Chiffres
- Les modèles réussissent presque 100 % des tâches qui prennent moins de 4 minutes à un humain, et moins de 10 % de celles qui dépassent environ 4 heures (METR, mars 2025).
- Horizon à 50 % de réussite mesuré début 2026 : environ 320 minutes pour Claude Opus 4.5 et 214 pour GPT-5, avec des intervalles de confiance très larges.
- Sur des tâches de bureau réalistes, le meilleur agent testé n’en termine que 30,3 %.
Remèdes du catalogue
- C2 · Planifier puis exécuter — Un plan découpé en étapes, relu avant l’exécution, puis exécuté une étape à la fois.
- D6 · Harnais longue durée — Une fonctionnalité par session, un fichier de progression et un commit à chaque étape, pour reprendre sans repartir de zéro.
- D2 · Notes structurées et plan récité — Le plan et l’avancement sont écrits hors du contexte et relus au début de chaque étape.
- B1 · Chaîne séquentielle — Chaque étape se termine par un contrôle qui vérifie le résultat avant de passer à la suivante.
Mesures hors catalogue
- Estimer la durée humaine de la tâche et la comparer à l’horizon mesuré du modèle avant de la confier d’un bloc.
Patterns détournés
Anti-patterns voisins
Sources
- Measuring AI Ability to Complete Long Software Tasks — METR, 2025-03-19
- Time Horizon 1.1 — METR, 2026-01-29
- TheAgentCompany — Xu et al., arXiv, 2024-12-18
- Effective harnesses for long-running agents — Anthropic (J. Young), 2025-11-26
- The Illusion of Diminishing Returns — Sinha et al. (ICLR 2026), 2025-09
Contenu relu le 2026-10-05