F3 · Cascade et routage de modèles
Famille : Supervision et exploitation
Chaque requête va au modèle le moins cher capable de la traiter, et monte d’un cran si la confiance est insuffisante.
Principe
On envoie d’abord la requête à un petit modèle, et on ne monte vers un plus gros que si la confiance est trop faible : c’est la cascade. Un routeur appris peut aussi choisir directement le bon modèle. Autres variantes : un modèle fort dirige et des modèles légers exécutent, ou un modèle faible consulte un modèle fort au besoin.
Le problème qu'il résout
Envoyer chaque requête au plus gros modèle coûte cher, alors qu’une grande part d’entre elles sont simples.
Quand l'utiliser
- Le trafic mêle cas simples et cas difficiles, et l’on dispose d’un juge ou d’un score de confiance fiable.
- Un jeu d’évaluation permet de calibrer le seuil de montée vers le gros modèle.
Quand l'éviter
- Il n’y a ni juge fiable ni jeu d’évaluation : le seuil de montée ne peut pas être calibré.
- Les gains dépendent beaucoup de la tâche (−85 % sur MT-Bench, mais −45 % sur MMLU avec RouteLLM) : mesurer sur ses propres données avant de s’engager.
Synonymes par éditeur
- Model cascade (FrugalGPT)
- Learned router (RouteLLM (LMSYS))
- Smart friend (Cognition (2026))
- Single-agent then multi-agent cascade (Gao et al. (2025))
Patterns voisins
Sources
- FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance — arXiv, 2023-05
- RouteLLM: An Open-Source Framework for Cost-Effective LLM Routing — LMSYS, 2024-07-01
- RouteLLM: Learning to Route LLMs with Preference Data — arXiv, 2024-06
- Single-agent or Multi-agent Systems? Why Not Both? — Gao et al., arXiv, 2025-05
- AI Agents That Matter — Kapoor, Stroebl, Siegel, Nadgir, Narayanan (Princeton), arXiv, 2024-07
Contenu relu le 2026-10-02