Nouveau terme : modèle de raisonnement
2024-09-12 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
Un modèle de raisonnement est entraîné à « réfléchir » avant de répondre en produisant une chaîne de pensée. Le test-time compute (calcul à l'inférence) désigne ce calcul supplémentaire, devenu un nouveau levier de performance.
Ce qui change
- Un second axe de progrès apparaît : laisser le modèle réfléchir plus longtemps, et pas seulement l'entraîner davantage.
- Les fournisseurs facturent des jetons de raisonnement que l'utilisateur ne voit pas.
- Les gammes se séparent entre modèles rapides et modèles « qui réfléchissent ».
- Le niveau d'effort de réflexion devient un paramètre d'usage courant.
### Définition Un **modèle de raisonnement** est un grand modèle de langage entraîné, notamment par apprentissage par renforcement, à produire une chaîne de pensée avant sa réponse finale. Le **test-time compute** (calcul à l'inférence) désigne la puissance de calcul consommée au moment de répondre : plus on en accorde, meilleurs sont les résultats sur les problèmes difficiles. ### Origine Le 12 septembre 2024, OpenAI présente o1-preview et o1-mini dans le billet « Learning to reason with LLMs » : « We've developed a new series of AI models designed to spend more time thinking before they respond » (« Nous avons développé une nouvelle série de modèles d'IA conçus pour passer plus de temps à réfléchir avant de répondre »). OpenAI précise que la performance de o1 « consistently improves with more reinforcement learning (train-time compute) and with more time spent thinking (test-time compute) » (« s'améliore régulièrement avec plus d'apprentissage par renforcement (calcul à l'entraînement) et plus de temps de réflexion (calcul à l'inférence) »). ### Ce que le terme recouvre - Aux épreuves AIME 2024, GPT-4o résout en moyenne 12 % des problèmes, o1 74 % avec un seul essai. - Les jetons de raisonnement restent cachés dans l'API mais sont facturés comme jetons de sortie. - Qwen QwQ, Gemini Flash Thinking, DeepSeek R1 puis Claude avec réflexion étendue reprennent l'approche dans les mois suivants. ### Critiques et limites Le raisonnement coûte cher, allonge les temps de réponse et n'apporte rien sur les tâches simples. La fidélité de la chaîne de pensée affichée au calcul réel du modèle reste discutée, et le mot « raisonnement » lui-même fait débat. ### À retenir Depuis o1, la qualité d'une réponse se règle aussi par le temps de réflexion accordé au modèle, avec un compromis explicite entre précision, coût et latence.
Liens
Tags : Vocabulaire, Raisonnement, Inférence, Coûts