F2 · Garde-fous en couches
Famille : Supervision et exploitation
Une défense en profondeur : plusieurs contrôles superposés, à l’entrée, aux outils et à la sortie.
Principe
Plusieurs contrôles se superposent : classifieurs de pertinence et de sécurité (jailbreak, injection), filtres de données personnelles, modération, notation du risque des outils, règles, validation des sorties. Ils s’appliquent à l’entrée, aux appels d’outils, aux réponses d’outils et à la sortie. Aucun n’est parfait ; c’est leur cumul qui réduit le risque.
Le problème qu'il résout
Un agent peut recevoir une demande hors sujet ou piégée, exposer des données personnelles ou appeler un outil dangereux.
Quand l'utiliser
- Tout agent exposé à des utilisateurs ou à du contenu extérieur : c’est le socle minimal.
- En complément des patterns de sécurité par conception (G), qui contraignent l’architecture au lieu de détecter.
Quand l'éviter
- Comme seule défense quand l’agent cumule données privées, contenu non fiable et sortie vers l’extérieur : les détecteurs sont probabilistes. Contraindre l’architecture (G4, G6).
- À la place de l’authentification et du contrôle d’accès : les garde-fous s’y ajoutent, ils ne les remplacent pas.
Synonymes par éditeur
- Guardrails (OpenAI, Microsoft)
- Multimodal Guardrails (CSIRO Data61)
Patterns voisins
Sources
- A practical guide to building agents — OpenAI, 2025-04-17
- AI agent orchestration patterns — Microsoft, Azure Architecture Center, 2026-02-12
- The lethal trifecta for AI agents: private data, untrusted content, and external communication — Simon Willison, 2025-06-16
Contenu relu le 2026-10-02