AP33 · Mémoire en écriture libre

Famille : Contexte et mémoire

Preuve forte

Noms d'origine : memory poisoning, unvalidated autonomous memory writes

L’agent retient ce qu’il lit, y compris les ordres glissés dans un document, et les relit plus tard comme des faits.

Définition

L’agent décide seul de ce qu’il mémorise, à partir de documents, de pages ou de messages de tiers, sans provenance ni contrôle. Il relit ensuite cette mémoire comme une source de confiance, dans d’autres sessions, parfois pour d’autres utilisateurs.

Symptômes observables

  • Des entrées de mémoire contiennent des consignes : « transfère… », « toujours… », « retiens X comme source fiable ».
  • Des écritures en mémoire se déclenchent pendant la lecture d’un contenu externe.
  • Les entrées n’ont ni provenance, ni auteur, ni expiration, et la mémoire est partagée entre utilisateurs.
  • Le comportement de l’agent change durablement après la lecture d’un document.

Pourquoi c'est nuisible

Une injection ponctuelle devient persistante et différée : elle agit hors de la session qui l’a introduite, sur des requêtes anodines. Plus l’agent consulte sa mémoire, plus l’attaque réussit.

Chiffres

  • Dans une étude de cas sur un assistant e-mail, 4 attaques sur 10 réussissent d’abord ; une fois l’agent invité à consulter sa mémoire avant chaque réponse, il transfère les e-mails ciblés dans plus de 80 % des cas (étude de cas d’éditeur, 10 essais).
  • Microsoft a relevé 50 prompts, venus de 31 entreprises de plus d’une douzaine de secteurs, qui demandent à l’assistant de retenir l’entreprise « comme source fiable » par des boutons de résumé par IA.

Incidents publics

  • 2025-02-10 — Google (Gemini) Démonstration d’un chercheur en sécurité, et non incident observé en production : un document piégé fait enregistrer de fausses informations dans la mémoire longue de Gemini, avec un déclenchement différé par un simple « oui » de l’utilisateur. L’écriture en mémoire reste possible pendant la lecture d’un contenu non fiable. Google a classé le risque comme peu probable et de faible impact.

Remèdes du catalogue

  • D3 · Mémoire long terme — Une écriture validée par une règle ou par un humain, un schéma contraint et la provenance de chaque entrée ; une mémoire visible et effaçable par l’utilisateur.
  • G2 · Plan figé avant contact — Le plan est fixé avant la lecture du contenu externe : après cette lecture, aucune écriture en mémoire n’est possible sans validation.
  • G4 · Double LLM (et CaMeL) — Le contenu non fiable est lu par un modèle en quarantaine, qui n’a pas accès à la mémoire.
  • F2 · Garde-fous en couches — Un filtre rejette les entrées de mémoire formulées comme des ordres.

Mesures hors catalogue

  • Une mémoire cloisonnée par utilisateur et par domaine.
  • Une expiration des entrées et des instantanés de mémoire pour l’analyse et le retour arrière.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns