Ring-2.5-1T
2026-02-10 · Éditeur : Ant Group · Domaine : Intelligence Artificielle
Ant Group ouvre Ring-2.5-1T, un modèle de raisonnement de 1 billion de paramètres à attention linéaire hybride, sous licence MIT, qui atteint le niveau or à l'OMI 2025 et au CMO 2025 selon l'éditeur.
Ce qui change
- Attention linéaire hybride à grande échelle : les couches d'attention groupée de Ling 2.0 sont converties en un mélange de 1 couche MLA pour 7 couches d'attention linéaire (Lightning Linear), ce qui, selon l'éditeur, réduit les accès mémoire de plus de 10 fois et multiplie le débit de génération pa…
- Raisonnement plus rigoureux : ajout de récompenses denses qui évaluent la rigueur du raisonnement en plus de la justesse finale ; à l'OMI 2025 (score maximal 42), 35 points, niveau or ; au CMO 2025 (score maximal 126), 105 points, au-dessus du seuil d'or (78) et de la barre de sélection de l'équipe…
- Exécution de tâches longues : apprentissage par renforcement d'agents entièrement asynchrone, avec adaptation aux cadres de programmation d'agents comme Claude Code et OpenClaw selon la fiche.
- Mode de réflexion intensive (« heavy thinking » en anglais) : réflexion parallèle et synthèse pour échanger du calcul contre de la qualité au moment de l'inférence.
- Solutions détaillées à l'OMI et au CMO publiées sur GitHub.
Ant Group ouvre Ring-2.5-1T, un modèle de raisonnement de 1 billion de paramètres à attention linéaire hybride, sous licence MIT, qui atteint le niveau or à l'OMI 2025 et au CMO 2025 selon l'éditeur. ### Contexte Ring-2.5-1T succède à Ring-1T (octobre 2025). Entre-temps, la course s'est déplacée vers les agents de longue durée, où le coût de la génération sur contextes longs devient le goulot d'étranglement. L'équipe inclusionAI répond par une architecture hybride, Ling 2.5, dérivée de Ling 2.0 par entraînement incrémental. ### Ce que le modèle apporte - Attention linéaire hybride à grande échelle : les couches d'attention groupée de Ling 2.0 sont converties en un mélange de 1 couche MLA pour 7 couches d'attention linéaire (Lightning Linear), ce qui, selon l'éditeur, réduit les accès mémoire de plus de 10 fois et multiplie le débit de génération par plus de 3 au-delà de 32 000 tokens. - Raisonnement plus rigoureux : ajout de récompenses denses qui évaluent la rigueur du raisonnement en plus de la justesse finale ; à l'OMI 2025 (score maximal 42), 35 points, niveau or ; au CMO 2025 (score maximal 126), 105 points, au-dessus du seuil d'or (78) et de la barre de sélection de l'équipe nationale (87). Ces épreuves sont auto-testées. - Exécution de tâches longues : apprentissage par renforcement d'agents entièrement asynchrone, avec adaptation aux cadres de programmation d'agents comme Claude Code et OpenClaw selon la fiche. - Mode de réflexion intensive (« heavy thinking » en anglais) : réflexion parallèle et synthèse pour échanger du calcul contre de la qualité au moment de l'inférence. - Solutions détaillées à l'OMI et au CMO publiées sur GitHub. ### Architecture et caractéristiques - Architecture : MoE de 1 billion de paramètres, environ 63 milliards de paramètres actifs (contre 51 milliards pour Ling 2.0), attention hybride MLA et Lightning Linear au ratio 1:7. - Contexte : 128 000 tokens étendus à 256 000 par YaRN. Modalités : texte. - Licence : MIT. Poids : Ring-2.5-1T sur Hugging Face et ModelScope (BF16 et FP8 pris en charge par SGLang). - Entraînement : nombre de tokens et coupure des connaissances non communiqués. ### Coût et accès La fiche indique que l'essai en ligne et l'API arrivent bientôt : aucun tarif n'est publié. Pour l'auto-hébergement, l'exemple de la fiche réutilise une configuration multi-nœuds (4 nœuds, parallélisme tensoriel 8 et de pipeline 4) avec une branche dédiée de SGLang. | Poste | Information | | --- | --- | | API officielle | Tarif non communiqué (annoncé « bientôt ») | | Auto-hébergement | Multi-nœuds (exemple 4 nœuds), branche SGLang dédiée | | Licence | MIT | ### Benchmarks | Indicateur | Valeur publiée par l'éditeur | | --- | --- | | OMI 2025 (score maximal 42) | 35 points, niveau or (auto-testé) | | CMO 2025 (score maximal 126) | 105 points ; seuil d'or 78, barre nationale 87 (auto-testé) | | Débit de génération au-delà de 32 000 tokens | Plus de 3 fois celui de la version précédente (annonce) | | Accès mémoire au-delà de 32 000 tokens | Réduction de plus de 10 fois (annonce) | Source : fiche Hugging Face de Ring-2.5-1T. Le tableau comparatif avec les modèles fermés est une image sans valeurs en texte ; aucune comparaison chiffrée avec des modèles fermés n'est donc reprise ici. ### Face aux modèles fermés La fiche compare Ring-2.5-1T à DeepSeek-V3.2 et Kimi-K2.5 (ouverts) et à GPT-5.2, Gemini 3 Pro et Claude Opus 4.5 (fermés) et affirme un niveau de pointe parmi les modèles ouverts sur l'IMO AnswerBench, l'AIME 26, HMMT 25, LiveCodeBench, ARC-AGI-V2, Gaia2, Tau2-bench et SWE-Bench Verified, mais les valeurs ne figurent qu'en image et ne peuvent pas être reprises ici. L'éditeur ne revendique pas la parité avec les modèles fermés dans le texte. Les résultats d'olympiades sont auto-testés, avec les solutions publiées, ce qui permet la vérification. Aucun tarif n'est disponible pour situer l'écart de coût. Ce qui est documenté, c'est l'avantage d'efficacité de l'attention hybride sur les contextes longs, pertinent pour les agents de longue durée hébergés en interne. ### À retenir Ring-2.5-1T est le premier modèle de raisonnement à 1 billion de paramètres à attention linéaire hybride, avec un gain de débit annoncé de plus de 3 fois sur les contextes longs. Les comparaisons chiffrées avec les modèles fermés ne sont pas disponibles en texte : il faut lire les images de la fiche pour les vérifier.
Liens
Tags : LLM, Open Source, inclusionAI, Ant Group, Ring, MIT, MoE, Attention linéaire