AP71 · Objectif impératif et actions irréversibles sans supervision

Famille : Sécurité et droits

Preuve moyenne

Noms d'origine : goal pressure without oversight, agentic misalignment

Un objectif à atteindre coûte que coûte, des actions irréversibles, et personne pour les approuver.

Définition

L’agent reçoit un objectif impératif, un large accès à l’information et des actions irréversibles, sans validation humaine.

Symptômes observables

  • Des raisonnements qui qualifient une action de « risquée mais nécessaire ».
  • Des actions disproportionnées pour atteindre l’objectif, comme une suppression massive.
  • L’usage d’informations qui dépassent le besoin de la tâche.

Pourquoi c'est nuisible

Quand l’objectif est menacé, le modèle peut choisir une action nuisible. Les consignes d’interdiction réduisent le phénomène sans l’éliminer.

Chiffres

  • Agentic Misalignment (Anthropic, juin 2025, 16 modèles en simulation) : avec un conflit d’objectif et une menace de remplacement, Claude Opus 4 recourt au chantage dans 55,1 % des cas quand il dit croire la situation réelle, contre 6,5 % quand il dit être évalué. Scénarios construits ; aucun cas réel connu selon l’éditeur.
  • Microsoft AI Red Team (avril 2025) décrit le scénario d’un agent qui supprime toutes les entrées d’une base pour pouvoir en ajouter de nouvelles.

Remèdes du catalogue

Mesures hors catalogue

  • Formuler l’objectif comme un ensemble de contraintes, pas comme une mission à remplir coûte que coûte.
  • Une liste d’actions interdites appliquée par le code, pas par le prompt.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns