Ling-1T
2025-10-09 · Éditeur : Ant Group · Domaine : Intelligence Artificielle
Ant Group, via son équipe inclusionAI, ouvre Ling-1T, un modèle de langage à 1 billion de paramètres (environ 50 milliards actifs), non raisonneur, sous licence MIT, entraîné en précision FP8.
Ce qui change
- Sparsité élevée : 1/32 d'experts activés, environ 51 milliards de paramètres actifs sur 1 000 milliards, guidée par des lois d'échelle propres à l'équipe (Ling Scaling Laws).
- Plus grand modèle de fondation entraîné en FP8 connu selon l'éditeur : gain d'environ 15 % de vitesse de bout en bout et écart de perte inférieur ou égal à 0,1 % par rapport à BF16 sur 1 000 milliards de tokens.
- Chaîne de pensée évolutive (Evo-CoT) et optimisation de politique au niveau de la phrase (LPO) : chaque phrase est traitée comme une unité d'action, entre le niveau du token et celui de la séquence.
- Récompense hybride syntaxe, fonction et esthétique pour la génération de code front-end : Ling-1T se classe premier des modèles ouverts à ArtifactsBench selon la fiche.
- Outils sans données d'agents massives : environ 70 % de précision d'appel d'outils à BFCL V3 avec un simple réglage léger (annonce de l'éditeur).
Ant Group, via son équipe inclusionAI, ouvre Ling-1T, un modèle de langage à 1 billion de paramètres (environ 50 milliards actifs), non raisonneur, sous licence MIT, entraîné en précision FP8. ### Contexte Début octobre 2025, les modèles ouverts les plus grands sont Kimi-K2 (environ 1 043 milliards de paramètres) et DeepSeek-V3.1 (671 milliards). Ant Group avait publié en septembre les petits modèles Ling-mini-2.0 (16 milliards) et Ling-flash-2.0 (103 milliards) ; Ling-1T est le plus grand de la famille Ling 2.0 et sert de base au modèle de raisonnement Ring-1T. ### Ce que le modèle apporte - Sparsité élevée : 1/32 d'experts activés, environ 51 milliards de paramètres actifs sur 1 000 milliards, guidée par des lois d'échelle propres à l'équipe (Ling Scaling Laws). - Plus grand modèle de fondation entraîné en FP8 connu selon l'éditeur : gain d'environ 15 % de vitesse de bout en bout et écart de perte inférieur ou égal à 0,1 % par rapport à BF16 sur 1 000 milliards de tokens. - Chaîne de pensée évolutive (Evo-CoT) et optimisation de politique au niveau de la phrase (LPO) : chaque phrase est traitée comme une unité d'action, entre le niveau du token et celui de la séquence. - Récompense hybride syntaxe, fonction et esthétique pour la génération de code front-end : Ling-1T se classe premier des modèles ouverts à ArtifactsBench selon la fiche. - Outils sans données d'agents massives : environ 70 % de précision d'appel d'outils à BFCL V3 avec un simple réglage léger (annonce de l'éditeur). ### Architecture et caractéristiques - Architecture : MoE de 1 000 milliards de paramètres, 51 milliards actifs (rapport technique), couche de prédiction multi-tokens, routage sans perte auxiliaire à score sigmoïde, normalisation QK. - Entraînement : plus de 20 000 milliards de tokens dont plus de 40 % de données riches en raisonnement en fin de pré-entraînement. - Contexte : 32 000 tokens étendus à 128 000 par YaRN. Modalités : texte. - Licence : MIT. Poids : Ling-1T sur Hugging Face et ModelScope. Coupure des connaissances : non communiquée. ### Coût et accès Aucun tarif d'API officiel n'a été trouvé pour Ling-1T : la fiche renvoie à la plateforme tierce ZenMux. Le matériel d'auto-hébergement n'est pas précisé ; l'échelle du billion de paramètres suppose plusieurs nœuds de GPU. | Poste | Information | | --- | --- | | API officielle | Tarif non communiqué | | Auto-hébergement | Non communiqué ; déploiement multi-nœuds attendu à cette taille | | Licence | MIT | ### Benchmarks | Benchmark | Ling-1T | GPT-5-main | Gemini 2.5 Pro (lowthink) | Kimi-K2-Instruct-0905 (ouvert) | | --- | --- | --- | --- | --- | | AIME 2025 (Pass@1) | 70,42 | 59,43 | 70,10 | 50,16 | | HMMT 2025 (Pass@1) | 47,08 | 36,98 | 60,73 | 38,80 | | LiveCodeBench (Pass@1) | 61,68 | 48,57 | 45,43 | 48,95 | | CodeForces (rating) | 1901 | 1120 | 1675 | 1574 | | ArtifactsBench | 59,31 | 41,04 | 60,28 | 44,87 | | ARC-AGI-1 (Pass@1) | 43,81 | 14,06 | 18,94 | 22,19 | | GPQA-Diamond (Pass@1) | 72,98 | 71,31 | 71,81 | 73,93 | | MMLU-Pro (Acc.) | 82,04 | 81,94 | 82,13 | 81,03 | | BFCL-V3 (appel de fonctions) | 69,64 | 50,27 | 63,31 | 71,05 | Source : rapport technique Ling 2.0 (arXiv 2510.22115), tableau 8. Scores mesurés par l'équipe Ling (éditeur) ; GPT-5-main et Gemini 2.5 Pro sont évalués avec un effort de raisonnement faible. ### Face aux modèles fermés Dans le tableau du rapport, Ling-1T devance GPT-5-main et Gemini 2.5 Pro (effort faible) sur le code (LiveCodeBench 61,68 contre 48,57 et 45,43 ; CodeForces 1901 contre 1120 et 1675) et à l'AIME 2025 face à GPT-5-main (70,42 contre 59,43), et il est à égalité avec Gemini 2.5 Pro sur ce test (70,10). Il est en retrait de Gemini 2.5 Pro à HMMT 2025 (47,08 contre 60,73) et à peu près au même niveau sur les connaissances générales (MMLU-Pro 82,04, GPQA-Diamond 72,98). La comparaison porte sur des configurations à faible effort de raisonnement : elle ne dit rien des versions à raisonnement élevé de ces modèles, plus fortes. L'écart de prix n'est pas établi faute de tarif public. Pour l'entreprise, l'intérêt est qu'un modèle non raisonneur de cette taille, sous licence MIT, se place au niveau de références fermées en mode économique, mais son exploitation exige une infrastructure multi-nœuds. ### À retenir Ling-1T montre qu'un MoE ouvert de 1 billion de paramètres peut être entraîné en FP8 avec une bonne stabilité et se mesurer aux modèles fermés en mode à faible effort de raisonnement. Il a surtout servi de base à Ring-1T, publié cinq jours plus tard.
Liens
Tags : LLM, Open Source, inclusionAI, Ant Group, Ling, MIT, MoE, 1T