AP25 · Contexte qui gonfle sans gestion
Famille : Contexte et mémoire
Preuve forte
Noms d'origine : context rot, context stuffing, context distraction
Tout s’accumule dans la fenêtre, et l’agent exploite de moins en moins bien ce qu’il a sous les yeux.
Définition
L’historique, les résultats d’outils et des documents entiers s’empilent dans le contexte, tour après tour, parce que la fenêtre est grande. Rien ne sélectionne, ne résume ni n’élague.
Symptômes observables
- La qualité des réponses baisse à mesure que la session s’allonge.
- Une information présente dans le contexte est ignorée : la réponse est meilleure quand on relance avec un contexte réduit.
- Dans les traces, les tokens d’entrée croissent à chaque tour sans aucune compaction.
Pourquoi c'est nuisible
La capacité d’un modèle à exploiter une information baisse avec la longueur de l’entrée, même quand il la retrouve parfaitement. La position de l’information et la présence de distracteurs aggravent l’effet. Et chaque tour relit tout ce qui précède : le coût monte pendant que la qualité baisse.
Un choix défendable quand…
- Une tâche courte, de quelques tours, dont le contexte reste loin des longueurs où la qualité se dégrade.
Chiffres
- À 32 000 tokens, 11 modèles sur 13 tombent sous la moitié de leur score en contexte court ; GPT-4o passe de 99,3 % à 69,7 %.
- Même quand le modèle retrouve parfaitement toute l’information utile, sa performance baisse de 13,9 % à 85 % quand l’entrée s’allonge.
- Sur LongMemEval, un prompt ciblé d’environ 300 tokens fait mieux que le prompt complet d’environ 113 000 tokens (étude de Chroma, éditeur d’une base vectorielle).
Remèdes du catalogue
- D1 · Compaction — Résumer l’historique à l’approche d’un seuil, en gardant les décisions, les fichiers ouverts et l’objectif.
- D2 · Notes structurées et plan récité — Tenir des notes de l’objectif et des preuves, récitées en fin de contexte plutôt que noyées au milieu.
- D5 · Sous-agent d’isolation de contexte — Confier les grosses lectures à un sous-agent qui travaille dans son propre contexte et ne rend qu’une synthèse.
- C6 · Recherche agentique — Aller chercher l’information au moment où l’étape en a besoin, au lieu de tout charger d’avance.
Mesures hors catalogue
- Suivre les tokens d’entrée par tour et alerter quand ils croissent sans compaction.
Patterns détournés
Anti-patterns voisins
Sources
- NoLiMa: Long-Context Evaluation Beyond Literal Matching — Modarressi et al., ICML 2025, 2025-02
- Context Length Alone Hurts LLM Performance Despite Perfect Retrieval — Du et al., Findings of EMNLP 2025, 2025-10
- Context Rot — Hong, Troynikov et Huber, Chroma, 2025-07-14
Contenu relu le 2026-10-05