AP75 · Agent opéré à l’aveugle

Famille : Supervision, exploitation et gouvernance

Preuve moyenne

Noms d'origine : flying blind, no step-level traces

En production sans trace par étape : on ne peut ni rejouer une session, ni dire où elle a échoué.

Définition

L’agent tourne en production sans trace de chaque étape (appel de modèle, appel d’outil, passage entre agents), ou avec des traces que personne ne relie à une évaluation.

Symptômes observables

  • Impossible de rejouer une session à partir des journaux.
  • Aucun identifiant de conversation commun aux spans.
  • Les tokens et les coûts ne sont connus qu’en agrégé mensuel.
  • Les incidents se diagnostiquent à partir de captures d’écran envoyées par les utilisateurs.

Pourquoi c'est nuisible

Un agent n’est pas déterministe et ses erreurs s’accumulent. Sans trace par étape, on ne peut ni localiser la cause d’un échec, ni mesurer une dérive, ni appliquer une règle de détection. Même avec des traces complètes, trouver l’agent fautif reste difficile ; sans elles, c’est impossible.

Un choix défendable quand…

  • Un prototype interne utilisé par ses auteurs, qui suivent chaque session en direct.

Chiffres

  • Enquête LangChain (1 340 réponses, fin 2025) : 89 % des équipes ont une forme d’observabilité, mais 62 % seulement ont des traces détaillées par étape, et 37 % des évaluations en ligne. Enquête déclarative, publiée par un éditeur d’outils d’observabilité auprès d’un public déjà convaincu.
  • Avec des traces complètes, l’attribution automatique trouve l’agent fautif dans 53,5 % des cas, et l’étape fautive dans 14,2 % (Who&When, 2025).
  • Anthropic (juin 2025) : des traces complètes en production ont permis de diagnostiquer pourquoi ses agents de recherche échouaient, puis de corriger les problèmes de façon systématique.

Incidents publics

  • 2025-09-17 — Anthropic Dans son post-mortem de septembre 2025, Anthropic cite, parmi les causes du retard de détection, des contrôles de confidentialité qui limitaient l’accès des ingénieurs aux interactions des utilisateurs. Correctif annoncé : Anthropic annonce des évaluations plus sensibles et une évaluation continue sur la production.

Remèdes du catalogue

  • B5 · Générateur-évaluateur — Un évaluateur branché sur les traces de production note en continu un échantillon de sessions.
  • F2 · Garde-fous en couches — Les garde-fous écrivent leurs décisions dans la trace : ce qui a été bloqué, et pourquoi, se retrouve.
  • F5 · Budgets et coupe-circuits — Le coût et les tokens sont attribués à chaque session et à chaque sous-agent : un plafond ne s’applique qu’à ce qui est mesuré.

Mesures hors catalogue

  • Instrumenter selon les conventions OpenTelemetry GenAI (spans `invoke_agent` et `execute_tool`, usage, cache, identifiant de conversation), en prévoyant que les noms changent : elles sont encore au statut « Development ».
  • Pseudonymiser les traces dès la conception, pour que la confidentialité n’empêche pas le diagnostic.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns