G4 · Double LLM (et CaMeL)
Famille : Sécurité par conception
Un LLM privilégié détient les outils sans jamais voir le contenu non fiable ; un LLM en quarantaine le lit, sans outils.
Principe
Un LLM privilégié a des outils mais ne voit jamais le contenu non fiable ; un LLM en quarantaine le lit, sans aucun outil. Entre les deux, un contrôleur logiciel, qui n’est pas un LLM, manipule des références symboliques que le privilégié cite sans jamais en lire le contenu. CaMeL (Google DeepMind) généralise l’idée : programme généré, suivi de provenance des données et politiques de capacités.
Le problème qu'il résout
Un agent qui lit du contenu non fiable tout en disposant d’outils peut être détourné par une injection de prompt, et aucun filtre ne l’en empêche de façon fiable.
Quand l'utiliser
- L’agent a accès à des données sensibles et à des actions externes (e-mail, paiement, écriture) : séparer ces capacités par l’architecture.
- L’autonomie augmente et les trois propriétés de la règle de deux sont réunies (G6).
Quand l'éviter
- Le coût d’implémentation (interpréteur, politiques à écrire) n’est pas justifié par le risque : des garde-fous en couches (F2) ou un sélecteur d’actions (G1) peuvent suffire.
- On compte sur lui contre l’ingénierie sociale : l’utilisateur peut recopier un contenu piégé, et CaMeL protège surtout le flux de contrôle et l’exfiltration.
Synonymes par éditeur
- Dual LLM (Simon Willison (2023), Beurer-Kellner et al.)
- Privileged / quarantined LLM (Simon Willison)
- CaMeL (Google DeepMind)
Patterns voisins
Sources
- The Dual LLM pattern for building AI assistants that can resist prompt injection — Simon Willison, 2023-04-25
- Design Patterns for Securing LLM Agents against Prompt Injections — Beurer-Kellner et al. (14 auteurs), arXiv, 2025-06
- Defeating Prompt Injections by Design — Debenedetti et al. (Google DeepMind), arXiv, 2025-03
- The lethal trifecta for AI agents: private data, untrusted content, and external communication — Simon Willison, 2025-06-16
Contenu relu le 2026-10-02