AP05 · Un seul modèle pour tout
Famille : Cadrage et choix du niveau
Preuve moyenne
Noms d'origine : one-size-fits-all model
Le même modèle sert toutes les étapes, du reformatage trivial au raisonnement difficile.
Définition
On emploie le plus gros modèle partout « pour être tranquille », ou le plus petit partout pour économiser, sans routage ni cascade selon l’étape.
Symptômes observables
- Un seul identifiant de modèle dans toutes les traces.
- Des étapes triviales (classification, extraction, reformatage) servies par le modèle le plus cher.
- À l’inverse, des réessais en série sur les étapes difficiles confiées à un petit modèle, si bien que le coût par tâche réussie dépasse celui du gros modèle.
Pourquoi c'est nuisible
La difficulté varie fortement d’une étape à l’autre d’un agent. Un modèle unique paie trop cher les étapes faciles, ou échoue sur les difficiles et déclenche boucles et nouvelles tentatives.
Chiffres
- FrugalGPT : la performance de GPT-4 pour jusqu’à −98 % de coût, en cascade de modèles (banc d’essai de laboratoire).
- RouteLLM : −85 % de coût sur MT-Bench en gardant 95 % de la qualité de GPT-4, en routant chaque requête vers le modèle adapté.
Remèdes du catalogue
- F3 · Cascade et routage de modèles — Une cascade : un petit modèle traite d’abord, et seul ce qui échoue ou reste incertain monte vers le gros.
- B2 · Routage — Un routeur envoie chaque étape au modèle qui lui convient : petit modèle pour classer ou extraire, gros modèle pour raisonner.
- E1 · Orchestrateur et sous-agents — Un orchestrateur sur un gros modèle et des sous-agents sur un modèle moins cher, comme le système de recherche d’Anthropic (Opus pour orchestrer, Sonnet pour les sous-agents).
Mesures hors catalogue
- Mesurer le coût par tâche réussie, et non le coût par appel.
Patterns détournés
Anti-patterns voisins
Sources
- FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance — L. Chen, M. Zaharia et J. Zou, arXiv, 2023-05-09
- RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing — LMSYS (I. Ong et al.), 2024-07-01
- How we built our multi-agent research system — Anthropic, 2025-06-13
Contenu relu le 2026-10-05