Molmo 2 (4B, 8B et Molmo2-O 7B)
2025-12-16 · Éditeur : Ai2 · Domaine : Intelligence Artificielle
Ai2 publie Molmo 2, une famille de modèles multimodaux ouverts pour la vidéo, les images multiples et le pointage, en versions 4B et 8B (base Qwen 3) et Molmo2-O 7B (base Olmo).
Ce qui change
- Pointage vidéo, suivi d'objets avec identifiants persistants, légendage dense de vidéos, comptage par pointage et ancrage spatio-temporel.
- Neuf nouveaux jeux de données (9,19 millions d'exemples) dont Molmo2-Cap (104 000 vidéos), Molmo2-VideoPoint (plus de 300 000 requêtes) et Molmo2-VideoTrack (3 600 clips, 15 000 requêtes).
- Sur le suivi vidéo, Ai2 annonce que Molmo 2 dépasse les autres modèles ouverts et bat Gemini 3 Pro « de loin ».
- Sur la moyenne de 11 benchmarks d'images, le 8B se classe juste derrière GPT-5 et GPT-5 mini et devant Gemini 2.5 Pro, selon Ai2.
- Publication des poids, du code d'entraînement et d'inférence, des jeux de données et des outils d'évaluation.
Ai2 publie Molmo 2, une famille de modèles multimodaux ouverts pour la vidéo, les images multiples et le pointage, en versions 4B et 8B (base Qwen 3) et Molmo2-O 7B (base Olmo). ### Contexte Molmo (2024) avait introduit le pointage d'images. Molmo 2 étend cette capacité à la vidéo : pointage, suivi d'objets avec identifiants persistants et localisation dans l'espace et le temps. Ai2 le compare notamment à Gemini 3 Pro et à GPT-5 dans son annonce. ### Ce que le modèle apporte - Pointage vidéo, suivi d'objets avec identifiants persistants, légendage dense de vidéos, comptage par pointage et ancrage spatio-temporel. - Neuf nouveaux jeux de données (9,19 millions d'exemples) dont Molmo2-Cap (104 000 vidéos), Molmo2-VideoPoint (plus de 300 000 requêtes) et Molmo2-VideoTrack (3 600 clips, 15 000 requêtes). - Sur le suivi vidéo, Ai2 annonce que Molmo 2 dépasse les autres modèles ouverts et bat Gemini 3 Pro « de loin ». - Sur la moyenne de 11 benchmarks d'images, le 8B se classe juste derrière GPT-5 et GPT-5 mini et devant Gemini 2.5 Pro, selon Ai2. - Publication des poids, du code d'entraînement et d'inférence, des jeux de données et des outils d'évaluation. ### Architecture et caractéristiques Trois modèles : Molmo 2 8B et 4B (base Qwen 3) et Molmo2-O 7B (base Olmo, chaîne entièrement ouverte). Entrées : images, séries d'images, vidéos de longueur variable. Licence : Apache 2.0, avec la précision que certains jeux tiers utilisés à l'entraînement sont soumis à des restrictions de recherche académique ou non commerciales. Ouverture : poids, code, données et évaluations ; seule la variante Molmo2-O repose sur une base elle-même entièrement ouverte, les variantes Qwen 3 héritent des limites de Qwen. Disponible sur Hugging Face, GitHub, Ai2 Playground et l'API OpenRouter. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune API Ai2 ; accès via OpenRouter (tarif non relevé) | | Matériel | Non communiqué (4B et 8B) ; environ 17 Go en BF16 pour le 8B (calcul sur 8,66 milliards de paramètres) | | Poids | Molmo2-4B, Molmo2-8B, Molmo2-O-7B sur Hugging Face (14 décembre 2025) | ### Benchmarks | Comparaison publiée par Ai2 (qualitative) | Résultat | |---|---| | Suivi vidéo | Devant les modèles ouverts et devant Gemini 3 Pro « de loin » | | Raisonnement sur images (moyenne de 11 benchmarks) | Molmo 2 8B juste derrière GPT-5 et GPT-5 mini, devant Gemini 2.5 Pro | | Préférence humaine | En tête des modèles ouverts | Source : billet Ai2 et communiqué du 16 décembre 2025, comparaisons de l'éditeur ; les scores chiffrés ne figurent pas dans le texte consulté. ### Face aux modèles fermés C'est le seul jalon de cette série où l'éditeur compare directement son modèle à des modèles fermés : Gemini 3 Pro sur le suivi vidéo et GPT-5 et GPT-5 mini sur la moyenne des benchmarks d'images. Les chiffres n'ont pas pu être relevés, donc ces écarts restent des annonces d'Ai2. Ai2 choisit pour comparaison Gemini 3 Pro et GPT-5, modèles fermés récents de Google et d'OpenAI à cette date, ce qui indique le niveau visé, sans que l'écart soit chiffré ici. Le modèle 8B occupe environ 17 Go en BF16 et peut être auto-hébergé, alors que les modèles fermés sont des services par API. Le choix ouvert ou fermé se joue donc sur la maîtrise des données vidéo et le coût d'inférence, pas sur une parité générale. ### À retenir Molmo 2 apporte des capacités de pointage et de suivi vidéo dans des modèles ouverts, avec une variante Molmo2-O entièrement ouverte. Les comparaisons aux modèles fermés sont celles d'Ai2.
Liens
Tags : LLM, Multimodal, Vidéo, Open Source, Entièrement ouvert (Molmo2-O), Ai2, Molmo, Apache 2.0