G6 · Règle de deux
Famille : Sécurité par conception
Ne jamais réunir, en autonomie, les trois propriétés qui rendent une injection de prompt dangereuse.
Principe
Un agent devient dangereux dès qu’il cumule trois propriétés : [A] traiter des entrées non fiables, [B] accéder à des données sensibles ou privées, [C] changer l’état du monde ou communiquer vers l’extérieur. La règle de deux, formulée par Meta, impose d’en garder au plus deux en autonomie. Si les trois sont nécessaires, il faut un humain dans la boucle (F1) ou une séparation par l’architecture (G4).
Le problème qu'il résout
Simon Willison appelle « trifecta létale » le cumul de données privées, de contenu non fiable et d’un canal vers l’extérieur : une injection de prompt peut alors exfiltrer des données, et aucun filtre ne l’empêche de façon fiable.
Quand l'utiliser
- Dès la conception de tout agent : classer chaque capacité en A, B ou C avant de choisir l’architecture.
- Pour décider si un agent peut être autonome ou s’il doit être supervisé.
Quand l'éviter
- Comme protection unique : c’est un critère de conception plus qu’un pattern technique. Il ne dispense ni des garde-fous (F2) ni du moindre privilège.
Synonymes par éditeur
- Agents Rule of Two (Meta (2025))
- Lethal trifecta (Simon Willison (2025))
Patterns voisins
Sources
- The lethal trifecta for AI agents: private data, untrusted content, and external communication — Simon Willison, 2025-06-16
- Practical AI agent security — Meta, 2025-10-31
- Design Patterns for Securing LLM Agents against Prompt Injections — Beurer-Kellner et al. (14 auteurs), arXiv, 2025-06
Contenu relu le 2026-10-02