AP75 · Agent opéré à l’aveugle
Famille : Supervision, exploitation et gouvernance
Preuve moyenne
Noms d'origine : flying blind, no step-level traces
En production sans trace par étape : on ne peut ni rejouer une session, ni dire où elle a échoué.
Définition
L’agent tourne en production sans trace de chaque étape (appel de modèle, appel d’outil, passage entre agents), ou avec des traces que personne ne relie à une évaluation.
Symptômes observables
- Impossible de rejouer une session à partir des journaux.
- Aucun identifiant de conversation commun aux spans.
- Les tokens et les coûts ne sont connus qu’en agrégé mensuel.
- Les incidents se diagnostiquent à partir de captures d’écran envoyées par les utilisateurs.
Pourquoi c'est nuisible
Un agent n’est pas déterministe et ses erreurs s’accumulent. Sans trace par étape, on ne peut ni localiser la cause d’un échec, ni mesurer une dérive, ni appliquer une règle de détection. Même avec des traces complètes, trouver l’agent fautif reste difficile ; sans elles, c’est impossible.
Un choix défendable quand…
- Un prototype interne utilisé par ses auteurs, qui suivent chaque session en direct.
Chiffres
- Enquête LangChain (1 340 réponses, fin 2025) : 89 % des équipes ont une forme d’observabilité, mais 62 % seulement ont des traces détaillées par étape, et 37 % des évaluations en ligne. Enquête déclarative, publiée par un éditeur d’outils d’observabilité auprès d’un public déjà convaincu.
- Avec des traces complètes, l’attribution automatique trouve l’agent fautif dans 53,5 % des cas, et l’étape fautive dans 14,2 % (Who&When, 2025).
- Anthropic (juin 2025) : des traces complètes en production ont permis de diagnostiquer pourquoi ses agents de recherche échouaient, puis de corriger les problèmes de façon systématique.
Incidents publics
- 2025-09-17 — Anthropic Dans son post-mortem de septembre 2025, Anthropic cite, parmi les causes du retard de détection, des contrôles de confidentialité qui limitaient l’accès des ingénieurs aux interactions des utilisateurs. Correctif annoncé : Anthropic annonce des évaluations plus sensibles et une évaluation continue sur la production.
Remèdes du catalogue
- B5 · Générateur-évaluateur — Un évaluateur branché sur les traces de production note en continu un échantillon de sessions.
- F2 · Garde-fous en couches — Les garde-fous écrivent leurs décisions dans la trace : ce qui a été bloqué, et pourquoi, se retrouve.
- F5 · Budgets et coupe-circuits — Le coût et les tokens sont attribués à chaque session et à chaque sous-agent : un plafond ne s’applique qu’à ce qui est mesuré.
Mesures hors catalogue
- Instrumenter selon les conventions OpenTelemetry GenAI (spans `invoke_agent` et `execute_tool`, usage, cache, identifiant de conversation), en prévoyant que les noms changent : elles sont encore au statut « Development ».
- Pseudonymiser les traces dès la conception, pour que la confidentialité n’empêche pas le diagnostic.
Patterns détournés
Anti-patterns voisins
Sources
- How we built our multi-agent research system — Anthropic, 2025-06-13
- State of Agent Engineering — LangChain, 2025-12
- Which Agent Causes Task Failures and When? — Zhang et al., arXiv, 2025-04-30
- A postmortem of three recent issues — Anthropic, 2025-09-17
- Semantic Conventions for GenAI agent and framework spans — OpenTelemetry
Contenu relu le 2026-10-05