OLMo 2 32B

2025-03-13 · Éditeur : Ai2 · Domaine : Intelligence Artificielle

Ai2 publie OLMo 2 32B, un modèle de 32 milliards de paramètres entièrement ouvert (poids, données, code) qui, selon Ai2, dépasse GPT-3.5 Turbo et GPT-4o mini sur des benchmarks académiques.

Ce qui change

  • Entraînement sur 6 000 milliards de tokens (1,5 époque de OLMo-Mix-1124) puis post-entraînement Tülu 3.1 : SFT, DPO et RLVR.
  • Un coût de préentraînement annoncé à un tiers de celui de Qwen 2.5 32B pour des performances comparables.
  • Ai2 indique que le modèle égale ou dépasse GPT-3.5 Turbo, GPT-4o mini, Qwen 2.5 32B et Mistral 24B, et se rapproche de Qwen 2.5 72B et de Llama 3.1 et 3.3 70B.
  • Un cluster de 160 nœuds de 8 GPU H100 sur Google Cloud, avec plus de 1 800 tokens par seconde et par GPU (environ 38 % de MFU).
  • Publication des données de préentraînement (OLMo-Mix-1124), de mi-entraînement (Dolmino-Mix-1124), de post-entraînement et du code OLMo-core.

Ai2 publie OLMo 2 32B, un modèle de 32 milliards de paramètres entièrement ouvert (poids, données, code) qui, selon Ai2, dépasse GPT-3.5 Turbo et GPT-4o mini sur des benchmarks académiques. ### Contexte OLMo 2 existait en 7B et 13B depuis novembre 2024. Le 32B en est le plus grand modèle et le premier modèle entièrement ouvert que Ai2 dit supérieur à des modèles fermés d'OpenAI de petite taille. Il sert aussi de banc d'essai pour la recette de post-entraînement Tülu 3.1. ### Ce que le modèle apporte - Entraînement sur 6 000 milliards de tokens (1,5 époque de OLMo-Mix-1124) puis post-entraînement Tülu 3.1 : SFT, DPO et RLVR. - Un coût de préentraînement annoncé à un tiers de celui de Qwen 2.5 32B pour des performances comparables. - Ai2 indique que le modèle égale ou dépasse GPT-3.5 Turbo, GPT-4o mini, Qwen 2.5 32B et Mistral 24B, et se rapproche de Qwen 2.5 72B et de Llama 3.1 et 3.3 70B. - Un cluster de 160 nœuds de 8 GPU H100 sur Google Cloud, avec plus de 1 800 tokens par seconde et par GPU (environ 38 % de MFU). - Publication des données de préentraînement (OLMo-Mix-1124), de mi-entraînement (Dolmino-Mix-1124), de post-entraînement et du code OLMo-core. ### Architecture et caractéristiques 32 milliards de paramètres. Licence : Apache 2.0 (fiche HF de l'Instruct). Ouverture complète : poids, données de préentraînement, de mi-entraînement et de post-entraînement, code d'entraînement, journaux et détails. Contexte : non précisé dans les pages consultées (la fiche mentionne une longueur maximale de 2 048 tokens pour la configuration d'entraînement du post-entraînement, sans que ce soit la limite du modèle). Poids : OLMo-2-0325-32B (base), SFT, DPO et Instruct sur Hugging Face, compatibles Transformers et vLLM. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune ; démo dans le Ai2 Playground | | Matériel | Non communiqué ; environ 64 Go en BF16 (32 milliards de paramètres, calcul) | ### Benchmarks | Benchmark (fiche HF, Instruct) | OLMo 2 32B Instruct | Llama-3.3-70B | Qwen2.5-32B | |---|---|---|---| | Moyenne | 68,8 | 73,0 | 66,5 | | MATH | 49,7 | 71,8 | 77,9 | | GSM8k | 87,6 | 93,6 | 87,5 | | MMLU | 77,3 | 85,9 | 84,7 | Source : fiche Hugging Face allenai/OLMo-2-0325-32B-Instruct, publiée par Ai2 ; comparateurs ouverts. Le billet Ai2 cite GPT-3.5 Turbo et GPT-4o mini sans chiffres extractibles du texte. ### Face aux modèles fermés Ai2 affirme que le modèle égale ou dépasse GPT-3.5 Turbo et GPT-4o mini sur des benchmarks académiques ; le détail chiffré n'a pas pu être relevé, donc cette affirmation reste celle de l'éditeur. Au moment de sa sortie, ces deux modèles fermés d'OpenAI étaient de petite taille ou déjà anciens, pas les modèles de pointe. Face aux modèles ouverts, le tableau de la fiche place le 32B devant Qwen2.5-32B en moyenne (68,8 contre 66,5) mais derrière Llama-3.3-70B (73,0) et nettement derrière sur MATH (49,7 contre 77,9 pour Qwen). L'intérêt est la reproductibilité complète, utile pour la recherche et l'audit, plus que la performance brute. ### À retenir OLMo 2 32B est un jalon de transparence : un modèle de 32 milliards de paramètres dont tout l'entraînement est publié. Ses performances restent en retrait des meilleurs modèles ouverts de taille comparable sur les maths.

Liens

Tags : LLM, Open Source, Entièrement ouvert, Ai2, OLMo 2, Apache 2.0, Poids, données et code ouverts