LongCat-Flash-Chat

2025-09-01 · Éditeur : Meituan · Domaine : Intelligence Artificielle

Meituan ouvre LongCat-Flash-Chat, un modèle à experts de 560 milliards de paramètres dont 18,6 à 31,3 milliards actifs selon le contexte, sous licence MIT, très rapide en inférence et fort en tâches d'agents.

Ce qui change

  • Experts à calcul nul : un mécanisme qui alloue un budget de calcul dynamique aux tokens importants, ce qui fait varier les paramètres actifs de 18,6 à 31,3 milliards (environ 27 milliards en moyenne) ; un correcteur PID sur le biais des experts maintient la moyenne.
  • MoE à connexion raccourcie (ScMoE) : élargit la fenêtre de recouvrement entre calcul et communication, pour un débit supérieur à 100 tokens par seconde.
  • Stabilité à l'échelle : transfert d'hyperparamètres depuis de petits modèles, initialisation par croissance depuis un point de contrôle de moitié moins grand, calcul déterministe et détection des corruptions silencieuses de données.
  • Formation aux agents : pré-entraînement en deux étapes concentrant les données de raisonnement, mi-entraînement jusqu'à 128 000 tokens de contexte, et synthèse de tâches par un cadre multi-agents selon trois axes (traitement de l'information, complexité des outils, interaction avec l'utilisateur).
  • Modèle non raisonneur : LongCat-Flash-Chat est la version de discussion ; une variante Thinking a suivi (non traitée ici).

Meituan ouvre LongCat-Flash-Chat, un modèle à experts de 560 milliards de paramètres dont 18,6 à 31,3 milliards actifs selon le contexte, sous licence MIT, très rapide en inférence et fort en tâches d'agents. ### Contexte En septembre 2025, l'ouvert chinois comprend déjà DeepSeek-V3.1, Qwen3 et Kimi-K2. Meituan, plateforme de livraison et de services locaux, rejoint le mouvement avec un modèle dont la conception vise le débit : le rapport technique annonce un entraînement de plus de 20 000 milliards de tokens en 30 jours. ### Ce que le modèle apporte - Experts à calcul nul : un mécanisme qui alloue un budget de calcul dynamique aux tokens importants, ce qui fait varier les paramètres actifs de 18,6 à 31,3 milliards (environ 27 milliards en moyenne) ; un correcteur PID sur le biais des experts maintient la moyenne. - MoE à connexion raccourcie (ScMoE) : élargit la fenêtre de recouvrement entre calcul et communication, pour un débit supérieur à 100 tokens par seconde. - Stabilité à l'échelle : transfert d'hyperparamètres depuis de petits modèles, initialisation par croissance depuis un point de contrôle de moitié moins grand, calcul déterministe et détection des corruptions silencieuses de données. - Formation aux agents : pré-entraînement en deux étapes concentrant les données de raisonnement, mi-entraînement jusqu'à 128 000 tokens de contexte, et synthèse de tâches par un cadre multi-agents selon trois axes (traitement de l'information, complexité des outils, interaction avec l'utilisateur). - Modèle non raisonneur : LongCat-Flash-Chat est la version de discussion ; une variante Thinking a suivi (non traitée ici). ### Architecture et caractéristiques - Architecture : MoE de 560 milliards de paramètres au total, 18,6 à 31,3 milliards actifs (moyenne d'environ 27 milliards). - Contexte : 128 000 tokens. Entraînement : plus de 20 000 milliards de tokens en 30 jours. Modalités : texte. - Licence : MIT. Poids : meituan-longcat/LongCat-Flash-Chat sur Hugging Face ; rapport technique sur arXiv. - Coupure des connaissances : non communiquée. ### Coût et accès Le rapport technique indique un coût de service de 0,70 dollar par million de tokens de sortie à plus de 100 tokens par seconde ; c'est une estimation de Meituan pour son déploiement, non un tarif d'API vérifié. Le matériel d'auto-hébergement n'est pas précisé dans la fiche ; LMSYS a publié un billet sur le déploiement avec SGLang. | Poste | Information | | --- | --- | | Coût de service estimé (rapport technique) | 0,70 dollar par million de tokens de sortie | | Tarif d'API officiel | Non vérifié | | Licence | MIT | ### Benchmarks | Benchmark | LongCat-Flash | GPT-4.1 | Claude 4 Sonnet | Gemini 2.5 Flash | DeepSeek V3.1 (ouvert) | | --- | --- | --- | --- | --- | --- | | MMLU | 89,71 | 89,64 | 91,75 | 86,33 | 90,96 | | ArenaHard-V2 | 86,50 | 61,50 | 62,10 | 77,00 | 84,10 | | AIME 2024 (avg@10) | 70,42 | 47,00 | 47,00 | 79,67 | 66,30* | | GPQA-Diamond | 73,23 | 67,68 | 70,71 | 80,30 | 74,90* | | LiveCodeBench (pass@1) | 48,02 | 39,21 | 45,59 | 39,65 | 56,40* | | SWE-Bench-Verified | 60,40 | 48,60 | 68,00* | 40,60 | 66,00* | | TerminalBench | 39,51 | 28,40 | 40,74 | 12,35 | 31,30* | | τ²-Bench (telecom) | 73,68 | 35,20 | 46,20 | 16,50 | 38,50 | | IFEval | 89,65 | 85,58 | 88,35 | 83,92 | 86,69 | | GraphWalks-128k | 51,05 | 85,02 | 80,57 | 64,83 | 73,54 | Source : fiche Hugging Face de LongCat-Flash-Chat. Scores mesurés par Meituan, tableau unique ; * : valeur reprise d'un rapport public. Claude 4 Sonnet, Gemini 2.5 Flash et DeepSeek V3.1 sont évalués en mode sans raisonnement. ### Face aux modèles fermés Sur le tableau de l'éditeur, LongCat-Flash dépasse GPT-4.1 sur toutes les lignes retenues sauf GraphWalks-128k (51,05 contre 85,02), MMLU étant à égalité et devance Claude 4 Sonnet sur ArenaHard-V2 (86,50 contre 62,10), AIME 2024 (70,42 contre 47,00), IFEval et surtout τ²-Bench telecom (73,68 contre 46,20). Il est derrière Claude 4 Sonnet en génie logiciel (SWE-Bench-Verified 60,40 contre 68,00) et à peine derrière à TerminalBench (39,51 contre 40,74), et derrière Gemini 2.5 Flash sur GPQA-Diamond (73,23 contre 80,30) et AIME 2024 (70,42 contre 79,67). Le contexte long est un point faible net : 51,05 à GraphWalks-128k. Les modèles fermés comparés sont GPT-4.1, Claude 4 Sonnet et Gemini 2.5 Flash en mode sans raisonnement, des modèles de milieu de gamme de 2025 : aucun modèle fermé de raisonnement n'est dans le tableau. L'écart de prix n'est pas établi faute de tarif d'API vérifié. ### À retenir LongCat-Flash-Chat est le jalon d'entrée de Meituan : un MoE de 560 milliards de paramètres à calcul dynamique, très rapide, dont les résultats de l'éditeur dépassent souvent GPT-4.1 et approchent Claude 4 Sonnet sur les agents. Sa licence MIT et son rapport technique détaillé en font une référence de conception efficace.

Liens

Tags : LLM, Open Source, Meituan, LongCat, MIT, MoE, Agents