F3 · Cascade et routage de modèles

Famille : Supervision et exploitation

Chaque requête va au modèle le moins cher capable de la traiter, et monte d’un cran si la confiance est insuffisante.

Principe

On envoie d’abord la requête à un petit modèle, et on ne monte vers un plus gros que si la confiance est trop faible : c’est la cascade. Un routeur appris peut aussi choisir directement le bon modèle. Autres variantes : un modèle fort dirige et des modèles légers exécutent, ou un modèle faible consulte un modèle fort au besoin.

Le problème qu'il résout

Envoyer chaque requête au plus gros modèle coûte cher, alors qu’une grande part d’entre elles sont simples.

Quand l'utiliser

  • Le trafic mêle cas simples et cas difficiles, et l’on dispose d’un juge ou d’un score de confiance fiable.
  • Un jeu d’évaluation permet de calibrer le seuil de montée vers le gros modèle.

Quand l'éviter

  • Il n’y a ni juge fiable ni jeu d’évaluation : le seuil de montée ne peut pas être calibré.
  • Les gains dépendent beaucoup de la tâche (−85 % sur MT-Bench, mais −45 % sur MMLU avec RouteLLM) : mesurer sur ses propres données avant de s’engager.

Synonymes par éditeur

  • Model cascade (FrugalGPT)
  • Learned router (RouteLLM (LMSYS))
  • Smart friend (Cognition (2026))
  • Single-agent then multi-agent cascade (Gao et al. (2025))

Patterns voisins

Sources

Contenu relu le 2026-10-02

Catalogue des patterns