AP58 · Garde-fou probabiliste comme unique barrière

Famille : Sécurité et droits

Preuve forte

Noms d'origine : guardrail-only defense, detection as a boundary

Un filtre ou un classifieur d’injection fait office de frontière, sans aucune contrainte d’architecture derrière.

Définition

La protection contre l’injection de prompt repose sur un classifieur, un filtre ou une consigne au modèle. Si une attaque passe le filtre, rien dans l’architecture ne limite ce que l’agent peut faire.

Symptômes observables

  • La fiche système cite un « détecteur d’injection » comme seul contrôle.
  • Aucun outil n’est restreint après la lecture d’un contenu externe : page web, e-mail, ticket.
  • Les tests de sécurité rejouent un jeu d’attaques fixe, avec un seul essai par attaque.
  • Un taux de blocage de 95 % est présenté comme suffisant.

Pourquoi c'est nuisible

Dans un LLM, rien ne sépare les instructions des données. L’attaquant joue en second : il adapte son attaque au filtre et réessaie autant qu’il veut. Une défense mesurée sur des attaques connues dit peu de chose de sa tenue face à un attaquant qui s’adapte.

Un choix défendable quand…

  • Un agent sans outil d’action ni accès à des données sensibles, où une injection réussie ne produit qu’une mauvaise réponse : le filtre y suffit comme mesure d’hygiène.

Chiffres

  • NIST, avec l’AISI britannique (janvier 2025) : sur AgentDojo, avec Claude 3.5 Sonnet, le taux de détournement passe de 11 % à 81 % avec des attaques nouvelles, et de 57 % à 80 % quand chaque attaque est tentée 25 fois au lieu d’une.
  • Douze défenses récentes, dont la majorité annonçait un taux d’attaque réussie proche de zéro, sont contournées dans plus de 90 % des cas pour la plupart par des attaques adaptatives (préprint d’octobre 2025).
  • Claude for Chrome : 23,6 % d’attaques réussies sans protection, 11,2 % avec ; environ une attaque sur neuf passe encore (chiffres de l’éditeur, 123 cas).

Incidents publics

  • 2025-06 — Microsoft EchoLeak (CVE-2025-32711) : un seul e-mail piégé, sans aucune action de l’utilisateur, suffisait à exfiltrer des données. La chaîne d’attaque commençait par contourner le classifieur d’injection de Microsoft (XPIA), puis passait par des images chargées automatiquement. Correctif annoncé : Microsoft a corrigé la faille côté serveur en mai 2025, avant sa divulgation publique.

Remèdes du catalogue

  • G6 · Règle de deux — Ne jamais réunir, dans une même session autonome, contenu non fiable, données privées et canal de sortie, quelle que soit la qualité du filtre.
  • G2 · Plan figé avant contact — Arrêter le plan d’actions avant de lire le contenu externe : un texte piégé qui passe le filtre ne peut plus changer la suite des appels.
  • G4 · Double LLM (et CaMeL) — Le modèle qui lit le contenu non fiable n’a aucun outil ; le modèle privilégié ne manipule que des références à ce contenu.
  • F2 · Garde-fous en couches — Garder le classifieur, mais comme une couche parmi d’autres, derrière des règles déterministes sur les appels d’outils.

Mesures hors catalogue

  • Évaluer la défense avec des attaques adaptatives et des essais multiples, du point de vue de l’attaquant.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns