AP45 · Latence cumulée des sauts

Famille : Boucle, arrêt et orchestration

Preuve moyenne

Noms d'origine : multi-hop latency stacking

Des appels LLM enchaînés en série, sans budget de latence : la réponse arrive après la somme de toutes les étapes.

Définition

Des sauts LLM (agents, juges, reformulations) s’enchaînent en série sans budget de latence, parfois en attendant de façon synchrone que chaque vague de sous-agents ait fini.

Symptômes observables

  • La durée totale d’une trace est à peu près la somme des durées de ses étapes : rien ne tourne en parallèle.
  • Une latence au 95e centile qui augmente à chaque étape ajoutée.
  • Le sous-agent le plus lent dicte la durée de toute la vague.

Pourquoi c'est nuisible

Chaque saut ajoute le délai du premier token et le temps de génération ; en mode synchrone, une vague attend son membre le plus lent.

Chiffres

  • Anthropic indique que ses agents principaux exécutent les sous-agents de façon synchrone, ce qui simplifie la coordination mais crée des goulets d’étranglement.
  • Microsoft range la latence des sauts multiples parmi les écueils de l’orchestration multi-agent.
  • Dans l’enquête de LangChain (décembre 2025, panel de praticiens), la latence est la deuxième barrière citée (20 %), après la qualité.

Remèdes du catalogue

Mesures hors catalogue

  • Un budget de latence par étape, et une exécution asynchrone des sous-agents quand la coordination le permet.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns