AP25 · Contexte qui gonfle sans gestion

Famille : Contexte et mémoire

Preuve forte

Noms d'origine : context rot, context stuffing, context distraction

Tout s’accumule dans la fenêtre, et l’agent exploite de moins en moins bien ce qu’il a sous les yeux.

Définition

L’historique, les résultats d’outils et des documents entiers s’empilent dans le contexte, tour après tour, parce que la fenêtre est grande. Rien ne sélectionne, ne résume ni n’élague.

Symptômes observables

  • La qualité des réponses baisse à mesure que la session s’allonge.
  • Une information présente dans le contexte est ignorée : la réponse est meilleure quand on relance avec un contexte réduit.
  • Dans les traces, les tokens d’entrée croissent à chaque tour sans aucune compaction.

Pourquoi c'est nuisible

La capacité d’un modèle à exploiter une information baisse avec la longueur de l’entrée, même quand il la retrouve parfaitement. La position de l’information et la présence de distracteurs aggravent l’effet. Et chaque tour relit tout ce qui précède : le coût monte pendant que la qualité baisse.

Un choix défendable quand…

  • Une tâche courte, de quelques tours, dont le contexte reste loin des longueurs où la qualité se dégrade.

Chiffres

  • À 32 000 tokens, 11 modèles sur 13 tombent sous la moitié de leur score en contexte court ; GPT-4o passe de 99,3 % à 69,7 %.
  • Même quand le modèle retrouve parfaitement toute l’information utile, sa performance baisse de 13,9 % à 85 % quand l’entrée s’allonge.
  • Sur LongMemEval, un prompt ciblé d’environ 300 tokens fait mieux que le prompt complet d’environ 113 000 tokens (étude de Chroma, éditeur d’une base vectorielle).

Remèdes du catalogue

Mesures hors catalogue

  • Suivre les tokens d’entrée par tour et alerter quand ils croissent sans compaction.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns