Olmo 3 (7B et 32B) et Olmo 3.1
2025-11-20 · Éditeur : Ai2 · Domaine : Intelligence Artificielle
Ai2 publie Olmo 3 (7B et 32B), entièrement ouvert : données, code, poids et points de contrôle. Olmo 3-Think 32B est présenté comme le meilleur modèle de raisonnement 32B entièrement ouvert.
Ce qui change
- Quatre déclinaisons par taille : Base, Think (raisonnement), Instruct et RL Zero (7B, pour la recherche sur le renforcement).
- Publication de tout le flux : corpus Dolma 3 (environ 9 300 milliards de tokens de réserve dont 5 900 milliards pour le mélange de préentraînement), Dolma 3 Dolmino (100 milliards de tokens de mi-entraînement), Dolma 3 Longmino (environ 50 milliards de tokens de long contexte) et la suite Dolci pou…
- Un entraînement plus économe : Ai2 indique qu'Olmo 3-Think 32B est entraîné sur environ 6 fois moins de tokens que Qwen 3 32B pour des performances compétitives, et un renforcement 4 fois plus efficace grâce aux mises à jour de poids en vol et au traitement par lots continu.
- OlmoTrace, un outil qui relie les sorties du modèle à ses données d'entraînement.
- Olmo 3.1 Think 32B : trois semaines de RLVR supplémentaires, avec MATH 96,2, AIME 2024 80,6 et IFEval 93,8 (fiche HF).
Ai2 publie Olmo 3 (7B et 32B), entièrement ouvert : données, code, poids et points de contrôle. Olmo 3-Think 32B est présenté comme le meilleur modèle de raisonnement 32B entièrement ouvert. ### Contexte Après OLMo 2, Ai2 veut publier non seulement les poids mais tout le parcours d'entraînement, qu'il appelle le « flux du modèle » (model flow). Olmo 3 arrive alors que les modèles ouverts de taille comparable comme Qwen 3 sont publiés sans leurs données. Olmo 3.1, publié le 12 décembre 2025, prolonge l'entraînement par renforcement des variantes 32B. ### Ce que le modèle apporte - Quatre déclinaisons par taille : Base, Think (raisonnement), Instruct et RL Zero (7B, pour la recherche sur le renforcement). - Publication de tout le flux : corpus Dolma 3 (environ 9 300 milliards de tokens de réserve dont 5 900 milliards pour le mélange de préentraînement), Dolma 3 Dolmino (100 milliards de tokens de mi-entraînement), Dolma 3 Longmino (environ 50 milliards de tokens de long contexte) et la suite Dolci pour SFT, DPO et RL. - Un entraînement plus économe : Ai2 indique qu'Olmo 3-Think 32B est entraîné sur environ 6 fois moins de tokens que Qwen 3 32B pour des performances compétitives, et un renforcement 4 fois plus efficace grâce aux mises à jour de poids en vol et au traitement par lots continu. - OlmoTrace, un outil qui relie les sorties du modèle à ses données d'entraînement. - Olmo 3.1 Think 32B : trois semaines de RLVR supplémentaires, avec MATH 96,2, AIME 2024 80,6 et IFEval 93,8 (fiche HF). ### Architecture et caractéristiques Modèles denses décodeur seul de 7 et 32 milliards de paramètres, contexte d'environ 65 000 tokens. Préentraînement sur un cluster allant jusqu'à 1 024 H100 (7,7 milliers de tokens par GPU et par seconde pour le 7B), mi-entraînement sur 128 H100, post-entraînement sur 256 H100. Date limite des données : décembre 2024 selon la fiche HF de Think. Licence : Apache 2.0 (fiches HF), avec des lignes directrices d'usage responsable d'Ai2. Ouverture complète : poids, données de préentraînement, mi-entraînement, long contexte et post-entraînement, code, points de contrôle et journaux. Rapport technique : arXiv 2512.13961. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune API Ai2 ; démo dans le Ai2 Playground | | Matériel | Non communiqué ; environ 64 Go en BF16 pour le 32B (calcul sur 32,2 milliards de paramètres) ; quantification 8 bits possible | | Poids | Base, Think, Instruct, RL Zero sur Hugging Face (allenai/Olmo-3-…) | ### Benchmarks | Olmo 3-Think 32B (publié par Ai2) | Olmo 3-Think 32B | Qwen 3 32B | Gemma 3 27B | DeepSeek R1 Distill 32B | |---|---|---|---|---| | MATH | 96,1 | 95,4 | 87,4 | 92,6 | | AIME 2024 | 76,8 | 80,8 | 28,9 | 70,3 | | AIME 2025 | 72,5 | 70,9 | 22,9 | 56,3 | | LiveCodeBench v3 | 83,5 | 90,2 | 39,0 | 79,5 | | IFEval | 89,0 | 86,5 | 85,4 | 78,7 | | MMLU | 85,4 | 88,8 | 74,6 | 88,0 | | GPQA | 58,1 | 67,3 | 45,0 | 61,8 | Source : billet Ai2 du 20 novembre 2025, mesures Ai2. Une colonne Qwen 3 VL 32B Thinking existe dans le billet (MATH 96,7, AIME 2024 86,3). Tous les comparateurs sont ouverts. ### Face aux modèles fermés Le tableau d'Ai2 ne contient aucun modèle fermé, et aucune comparaison avec un modèle fermé n'a été trouvée dans les sources consultées. Face à Qwen 3 32B, Olmo 3-Think est devant sur MATH (96,1 contre 95,4) et IFEval (89,0 contre 86,5) mais en retrait sur LiveCodeBench v3 (83,5 contre 90,2) et sur GPQA (58,1 contre 67,3). Ai2 met donc en avant la transparence et l'efficacité d'entraînement plutôt qu'un score maximal. Pour un usage d'entreprise, l'intérêt est l'audit complet (données tracées par OlmoTrace, points de contrôle) et la possibilité de réentraîner, ce que les modèles fermés et les modèles seulement à poids ouverts n'offrent pas. ### À retenir Olmo 3 est la référence des modèles entièrement ouverts fin 2025 : données, code et poids publiés. Ses scores sont proches de Qwen 3 32B sans le dépasser sur tous les axes.
Liens
Tags : LLM, Open Source, Entièrement ouvert, Ai2, Olmo 3, Apache 2.0, Raisonnement