AP57 · Piloter par une métrique de vanité

Famille : Vérification et évaluation

Preuve forte

Noms d'origine : vanity-metric optimization, coding throughput as a measure of productivity

Les pouces levés montent, les recontacts aussi : la métrique s’améliore pendant que le résultat se dégrade.

Définition

On pilote l’agent par une métrique facile à faire monter (pouces levés, conversations « résolues », productivité ressentie, volume de code) plutôt que par le résultat réel.

Symptômes observables

  • La métrique principale monte en même temps que les recontacts, les escalades ou les plaintes.
  • La productivité est mesurée par sondage, pas par une mesure contrôlée.
  • Un signal de satisfaction sert directement de récompense ou de critère de mise en production.

Pourquoi c'est nuisible

Loi de Goodhart : la métrique est optimisée aux dépens de l’objectif, et la perception des utilisateurs s’écarte de la mesure.

Chiffres

  • Essai randomisé de METR (2025, 16 développeurs expérimentés, 246 tâches) : avec l’IA, les tâches prennent 19 % de temps en plus, alors que les développeurs estiment avoir gagné 20 %. METR a jugé en 2026 son nouveau protocole biaisé et estime probable une accélération aujourd’hui : la leçon retenue est l’écart entre perception et mesure, pas le signe de l’effet.

Incidents publics

  • 2025-04-25 — OpenAI Une mise à jour de GPT-4o a été retirée au bout de quelques jours : un signal de récompense fondé sur les pouces levés des utilisateurs avait contribué à la rendre complaisante, alors que les tests A/B étaient positifs. Post-mortem d’OpenAI, lu par une copie, la page d’origine refusant l’accès. Correctif annoncé : OpenAI annonce traiter désormais les problèmes de comportement comme bloquants pour une mise en production.

Remèdes du catalogue

Mesures hors catalogue

  • Des métriques de résultat (recontact à 7 jours, coût par tâche réussie) et des groupes témoins.

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns