AP55 · Comparer des architectures sans budget égal
Famille : Vérification et évaluation
Preuve moyenne
Noms d'origine : comparing architectures without equal budgets
Le multi-agent « gagne », avec dix fois plus de tokens que l’agent seul auquel on le compare.
Définition
On compare deux architectures sur la précision seule, sans leur donner le même budget de tokens ou de coût, ni les mesurer face à une base simple.
Symptômes observables
- L’architecture complexe l’emporte en consommant bien plus de tokens.
- Les résultats donnent la précision sans le coût.
- Aucune base simple (relance, vote) dans la comparaison.
Pourquoi c'est nuisible
Le gain attribué à l’architecture vient en grande partie du calcul supplémentaire. À budget égal, l’avantage se réduit ou disparaît.
Chiffres
- Sur HumanEval, une simple relance avec montée en température atteint 93,2 % pour 2,45 $, contre 88,0 % pour 134,50 $ avec LATS (réplication de Kapoor et al.).
- Tran et Kiela (2026) : à budget de tokens de raisonnement égal, l’agent seul égale ou bat le multi-agent en raisonnement à plusieurs sauts.
Remèdes du catalogue
- B4 · Échantillonnage et vote — Une base simple (relance, vote sur plusieurs essais) entre dans chaque comparaison, au même budget.
- F5 · Budgets et coupe-circuits — Le même plafond de tokens et de coût s’applique à chaque architecture comparée.
Mesures hors catalogue
- Rapporter coût et précision ensemble, sur la frontière coût-précision.
Anti-patterns voisins
Sources
- AI Agents That Matter — Kapoor, Stroebl, Siegel, Nadgir et Narayanan (Princeton), arXiv, 2024-07-01
- Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets — Tran et Kiela, arXiv, 2026-04-02
Contenu relu le 2026-10-05