AP26 · Empoisonnement du contexte
Famille : Contexte et mémoire
Preuve moyenne
Noms d'origine : context poisoning, session context contamination
Une erreur écrite dans le contexte devient un fait, que l’agent relit et renforce à chaque tour.
Définition
Une hallucination ou une donnée fausse entre dans l’objectif, le résumé ou les notes de l’agent, puis y est reprise comme une vérité. Dans sa version malveillante, un adversaire l’introduit exprès tôt dans la session.
Symptômes observables
- L’agent s’acharne sur un objectif impossible ou hors sujet.
- La même affirmation fausse revient d’un résumé à l’autre.
- Des actions absurdes se répètent pour atteindre un état qui n’existe pas.
- Le comportement redevient normal après un redémarrage sur un contexte propre.
Pourquoi c'est nuisible
Le contexte sert à la fois de mémoire et de vérité : rien n’y distingue un fait vérifié d’une supposition. Chaque compaction recopie l’erreur dans le résumé suivant, et plus l’historique contient d’erreurs, plus le modèle en commet.
Chiffres
- Dans le rapport technique de Gemini 2.5, l’agent qui joue à Pokémon voit ses objectifs et son résumé « empoisonnés » par une information fausse sur l’état du jeu, qui met très longtemps à se défaire ; il s’acharne alors sur des objectifs impossibles. Le rapport présente ces observations comme anecdotiques.
- Plus on injecte d’erreurs dans l’historique, plus la précision au 100e tour se dégrade, et ce n’est pas un simple effet de longueur (ICLR 2026).
- La taxonomie de Microsoft (version 2.0, juin 2026) ajoute un mode d’échec où un adversaire introduit tôt dans la session des données qui biaisent le raisonnement des étapes suivantes.
Remèdes du catalogue
- D1 · Compaction — La compaction vérifie le résumé avant de le réinjecter : une affirmation qu’aucune trace d’outil ne confirme n’y entre pas.
- D2 · Notes structurées et plan récité — Des notes structurées, en JSON plutôt qu’en texte libre, où chaque fait porte sa source et peut être vérifié.
- D5 · Sous-agent d’isolation de contexte — Les explorations risquées tournent dans un sous-agent jetable : une erreur y reste confinée.
- B5 · Générateur-évaluateur — Un évaluateur confronte les faits à l’état réel avant qu’ils n’entrent dans l’objectif ou les notes.
Mesures hors catalogue
- Repartir d’un contexte propre, avec la demande reformulée, quand l’agent s’acharne sur un objectif impossible.
Patterns détournés
Anti-patterns voisins
Sources
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities — Gemini Team, Google, 2025
- The Illusion of Diminishing Returns — Sinha, Arun, Goel, Staab et Geiping, ICLR 2026, 2025-09
- Updating the taxonomy of failure modes in agentic AI systems: what a year of What a year of red teaming taught us — Microsoft AI Red Team, 2026-06-04
- How Long Contexts Fail — Drew Breunig, 2025-06-22
Contenu relu le 2026-10-05