AP05 · Un seul modèle pour tout

Famille : Cadrage et choix du niveau

Preuve moyenne

Noms d'origine : one-size-fits-all model

Le même modèle sert toutes les étapes, du reformatage trivial au raisonnement difficile.

Définition

On emploie le plus gros modèle partout « pour être tranquille », ou le plus petit partout pour économiser, sans routage ni cascade selon l’étape.

Symptômes observables

  • Un seul identifiant de modèle dans toutes les traces.
  • Des étapes triviales (classification, extraction, reformatage) servies par le modèle le plus cher.
  • À l’inverse, des réessais en série sur les étapes difficiles confiées à un petit modèle, si bien que le coût par tâche réussie dépasse celui du gros modèle.

Pourquoi c'est nuisible

La difficulté varie fortement d’une étape à l’autre d’un agent. Un modèle unique paie trop cher les étapes faciles, ou échoue sur les difficiles et déclenche boucles et nouvelles tentatives.

Chiffres

  • FrugalGPT : la performance de GPT-4 pour jusqu’à −98 % de coût, en cascade de modèles (banc d’essai de laboratoire).
  • RouteLLM : −85 % de coût sur MT-Bench en gardant 95 % de la qualité de GPT-4, en routant chaque requête vers le modèle adapté.

Remèdes du catalogue

  • F3 · Cascade et routage de modèles — Une cascade : un petit modèle traite d’abord, et seul ce qui échoue ou reste incertain monte vers le gros.
  • B2 · Routage — Un routeur envoie chaque étape au modèle qui lui convient : petit modèle pour classer ou extraire, gros modèle pour raisonner.
  • E1 · Orchestrateur et sous-agents — Un orchestrateur sur un gros modèle et des sous-agents sur un modèle moins cher, comme le système de recherche d’Anthropic (Opus pour orchestrer, Sonnet pour les sous-agents).

Mesures hors catalogue

  • Mesurer le coût par tâche réussie, et non le coût par appel.

Patterns détournés

Anti-patterns voisins

Sources

Contenu relu le 2026-10-05

Catalogue des anti-patterns