AP55 · Comparer des architectures sans budget égal

Famille : Vérification et évaluation

Preuve moyenne

Noms d'origine : comparing architectures without equal budgets

Le multi-agent « gagne », avec dix fois plus de tokens que l’agent seul auquel on le compare.

Définition

On compare deux architectures sur la précision seule, sans leur donner le même budget de tokens ou de coût, ni les mesurer face à une base simple.

Symptômes observables

  • L’architecture complexe l’emporte en consommant bien plus de tokens.
  • Les résultats donnent la précision sans le coût.
  • Aucune base simple (relance, vote) dans la comparaison.

Pourquoi c'est nuisible

Le gain attribué à l’architecture vient en grande partie du calcul supplémentaire. À budget égal, l’avantage se réduit ou disparaît.

Chiffres

  • Sur HumanEval, une simple relance avec montée en température atteint 93,2 % pour 2,45 $, contre 88,0 % pour 134,50 $ avec LATS (réplication de Kapoor et al.).
  • Tran et Kiela (2026) : à budget de tokens de raisonnement égal, l’agent seul égale ou bat le multi-agent en raisonnement à plusieurs sauts.

Remèdes du catalogue

Mesures hors catalogue

  • Rapporter coût et précision ensemble, sur la frontière coût-précision.

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns