AP06 · Tâche plus longue que l’horizon fiable

Famille : Cadrage et choix du niveau

Preuve forte

Noms d'origine : horizon overreach, one-shotting

Une tâche de plusieurs heures confiée d’un bloc, que l’agent tente de produire d’une traite.

Définition

On confie d’un seul tenant à un agent une tâche dont la durée humaine dépasse nettement ce que le modèle réussit de façon fiable, sans découpage en étapes vérifiées ni point de reprise.

Symptômes observables

  • L’agent tente tout d’un coup et épuise son contexte en pleine implémentation.
  • À la reprise, le travail est à moitié fait et rien ne dit où il en est.
  • Le taux de réussite s’effondre quand la tâche s’allonge.

Pourquoi c'est nuisible

Les erreurs se composent : une précision par étape un peu inférieure à 100 % rend une longue séquence très improbable. Anthropic l’a observé sur ses agents de code, qui cherchaient à produire l’application d’une traite et laissaient un travail inachevé à la session suivante.

Chiffres

  • Les modèles réussissent presque 100 % des tâches qui prennent moins de 4 minutes à un humain, et moins de 10 % de celles qui dépassent environ 4 heures (METR, mars 2025).
  • Horizon à 50 % de réussite mesuré début 2026 : environ 320 minutes pour Claude Opus 4.5 et 214 pour GPT-5, avec des intervalles de confiance très larges.
  • Sur des tâches de bureau réalistes, le meilleur agent testé n’en termine que 30,3 %.

Remèdes du catalogue

Mesures hors catalogue

  • Estimer la durée humaine de la tâche et la comparer à l’horizon mesuré du modèle avant de la confier d’un bloc.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns