OpenAI o1 (Strawberry)
2024-09-12 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
OpenAI inaugure la série o1, des modèles entraînés par renforcement à « réfléchir » avant de répondre. o1-preview et o1-mini sortent dans ChatGPT et l'API ; o1 atteint 83 % à l'AIME 2024 contre 13 % pour GPT-4o.
Ce qui change
- Nouveau paradigme : le modèle produit une longue chaîne de pensée interne avant de répondre, et ses performances progressent avec le temps de réflexion accordé (calcul à l'inférence).
- Mathématiques : 74,4 % à l'AIME 2024 en un essai et 83,3 % par consensus sur 64 essais pour o1, contre 9,3 % et 13,4 % pour GPT-4o.
- Premier modèle à dépasser des experts titulaires d'un doctorat sur GPQA Diamond (77,3 % pour o1) ; 89e centile sur Codeforces.
- Deux modèles disponibles le jour même : o1-preview (15 USD en entrée et 60 USD en sortie par million de tokens) et o1-mini, 80 % moins cher et orienté code.
- Chaîne de pensée brute masquée à l'utilisateur, qui n'en voit qu'un résumé généré par le modèle.
OpenAI présente o1, une nouvelle série de modèles entraînés par apprentissage par renforcement à raisonner avant de répondre. Deux modèles sont ouverts le jour même, o1-preview et o1-mini, tandis que les scores publiés portent aussi sur o1, la version suivante alors en développement. OpenAI remet le compteur à 1 : la série s'appelle désormais OpenAI o1. ### Ce qui change - Le modèle produit une longue chaîne de pensée interne : il décompose le problème, repère et corrige ses erreurs, change d'approche si besoin. - Les performances augmentent avec le calcul d'entraînement par renforcement et avec le temps de réflexion à l'inférence, un nouvel axe de progression au-delà du pré-entraînement. - Écart massif avec GPT-4o sur les tâches de raisonnement : mathématiques de compétition, programmation, sciences. - La chaîne de pensée brute reste cachée ; l'utilisateur voit un résumé généré par le modèle. - Sécurité : sur l'un des tests de contournement (jailbreak) les plus difficiles d'OpenAI, o1-preview obtient 84 sur 100 contre 22 pour GPT-4o. ### Caractéristiques - o1-preview : contexte de 128 000 tokens, 32 768 tokens de sortie au maximum, coupure des connaissances à octobre 2023, texte uniquement (fiche modèle). - o1-mini : modèle plus rapide et 80 % moins cher, efficace en code, contexte de 128 000 tokens. - ChatGPT Plus et Team dès le lancement, avec 30 messages par semaine pour o1-preview et 50 pour o1-mini ; API réservée au palier d'usage 5, à 20 requêtes par minute, sans appel de fonctions, streaming ni message système. ### Tarifs au lancement | Modèle (USD par million de tokens) | Entrée | Sortie | | --- | --- | --- | | o1-preview | 15 | 60 | | o1-mini | 3 | 12 | ### Benchmarks publiés par l'éditeur Scores publiés par l'éditeur (pass@1 sauf mention). | Benchmark | GPT-4o | o1-preview | o1 | | --- | --- | --- | --- | | AIME 2024 | 9,3 % | 44,6 % | 74,4 % | | AIME 2024 (consensus sur 64) | 13,4 % | 56,7 % | 83,3 % | | Codeforces (Elo) | 808 | 1 258 | 1 673 | | GPQA Diamond | 50,6 % | 73,3 % | 77,3 % | | MATH | 60,3 % | 85,5 % | 94,8 % | | MMLU | 88,0 % | 90,8 % | 92,3 % | ### Pourquoi c'est un tournant o1 ouvre l'ère des modèles de raisonnement : la puissance ne dépend plus seulement de la taille du modèle mais aussi du temps de calcul consacré à chaque question. Toute l'industrie suivra cette voie. ### À retenir Moins polyvalent que GPT-4o à son lancement (ni navigation web ni envoi de fichiers), o1 s'impose sur les problèmes difficiles en sciences, en mathématiques et en programmation.
Liens
Tags : LLM, OpenAI, Raisonnement, o1, o1-preview, o1-mini, Chaîne de pensée