Step 3.5 Flash
2026-01-29 · Éditeur : StepFun · Domaine : Intelligence Artificielle
StepFun ouvre Step 3.5 Flash, un modèle à experts de 196 milliards de paramètres dont 11 milliards actifs, sous Apache 2.0, avec 256 000 tokens de contexte et une génération de 100 à 300 tokens par seconde.
Ce qui change
- Vitesse : prédiction de 4 tokens par passe (MTP-3) pour un débit de 100 à 300 tokens par seconde en usage courant et jusqu'à 350 en codage à flux unique.
- Agents et code : 74,4 % à SWE-bench Verified et 51,0 % à Terminal-Bench 2.0, avec un cadre d'apprentissage par renforcement extensible.
- Contexte long à coût réduit : attention à fenêtre glissante avec 3 couches glissantes pour 1 couche d'attention complète, pour 256 000 tokens.
- Exécution locale : StepFun cite le Mac Studio M4 Max et le NVIDIA DGX Spark ; en INT4 sur DGX Spark de 128 Go, le modèle génère environ 20 tokens par seconde avec 256 000 tokens de contexte.
- Mode de réflexion parallèle : la fiche montre des scores plus élevés avec une réflexion parallèle (barres estompées du graphique).
StepFun ouvre Step 3.5 Flash, un modèle à experts de 196 milliards de paramètres dont 11 milliards actifs, sous Apache 2.0, avec 256 000 tokens de contexte et une génération de 100 à 300 tokens par seconde. ### Contexte Step 3.5 Flash succède à Step3 (juillet 2025). Début 2026, les références ouvertes sont DeepSeek V3.2, Kimi K2.5 et GLM-4.7, et les références fermées Claude Opus 4.5, GPT-5.2 et Gemini 3 Pro, qui figurent dans le tableau de StepFun. Le modèle vise l'agent rapide : du raisonnement profond avec une latence faible. ### Ce que le modèle apporte - Vitesse : prédiction de 4 tokens par passe (MTP-3) pour un débit de 100 à 300 tokens par seconde en usage courant et jusqu'à 350 en codage à flux unique. - Agents et code : 74,4 % à SWE-bench Verified et 51,0 % à Terminal-Bench 2.0, avec un cadre d'apprentissage par renforcement extensible. - Contexte long à coût réduit : attention à fenêtre glissante avec 3 couches glissantes pour 1 couche d'attention complète, pour 256 000 tokens. - Exécution locale : StepFun cite le Mac Studio M4 Max et le NVIDIA DGX Spark ; en INT4 sur DGX Spark de 128 Go, le modèle génère environ 20 tokens par seconde avec 256 000 tokens de contexte. - Mode de réflexion parallèle : la fiche montre des scores plus élevés avec une réflexion parallèle (barres estompées du graphique). ### Architecture et caractéristiques - Architecture : MoE de 196,81 milliards de paramètres au total, environ 11 milliards actifs ; 45 couches, dimension cachée de 4 096, 288 experts routés et 1 partagé, 8 experts par token. - Contexte : 256 000 tokens. Vocabulaire : 128 896 tokens. Modalités : texte. Tête MTP : attention à fenêtre glissante et FFN dense. - Licence : Apache 2.0 (usage commercial libre). - Poids : stepfun-ai/Step-3.5-Flash sur Hugging Face et ModelScope ; API sur platform.stepfun.ai et OpenRouter. Coupure des connaissances : non communiquée. ### Coût et accès Selon des agrégateurs, l'API est tarifée environ 0,10 dollar par million de tokens en entrée et 0,30 dollar en sortie (0,09 dollar en entrée chez le moins cher des fournisseurs) ; la page officielle des tarifs n'a pas été consultée. Pour l'auto-hébergement, StepFun cite un Mac Studio M4 Max et un NVIDIA DGX Spark de 128 Go (INT4, environ 20 tokens par seconde). | Poste | Prix / configuration | | --- | --- | | Entrée (agrégateurs, USD par million de tokens) | 0,10 (dès 0,09 selon le fournisseur) | | Sortie (agrégateurs, USD par million de tokens) | 0,30 | | Local | DGX Spark 128 Go en INT4 : environ 20 tokens/s à 256 000 de contexte | ### Benchmarks | Benchmark | Step 3.5 Flash | Claude Opus 4.5 | GPT-5.2 xhigh | Gemini 3.0 Pro | | --- | --- | --- | --- | --- | | Moyenne de la sélection du billet | 81,0 | 80,6 | 82,2 | 80,7 | | AIME 2025 | 97,3 | 92,8 | 100,0 | 95,0 | | HMMT 2025 (moyenne) | 96,2 | 92,3 | 98,3 | 96,0 | | IMOAnswerBench | 85,4 | 84,0 | 86,3 | 83,3 | | LiveCodeBench-V6 | 86,4 | 84,8 | 87,7 | 90,7 | | SWE-bench Verified | 74,4 | 80,9 | 80,0 | 76,2 | | τ²-Bench | 88,2 | 92,5 | 85,5 | 90,7 | Source : billet officiel de StepFun (tableau de comparaison avec les modèles fermés), scores de l'éditeur. Les comparaisons avec DeepSeek V3.2, Kimi K2.5, GLM-4.7, MiniMax M2.1 et MiMo-V2 Flash (ouverts) figurent dans la fiche Hugging Face. ### Face aux modèles fermés Sur le raisonnement mathématique, Step 3.5 Flash se situe entre Claude Opus 4.5 et GPT-5.2 xhigh (AIME 2025 : 97,3 contre 92,8 et 100,0) et devant Gemini 3.0 Pro à l'AIME et à IMOAnswerBench. Il est en retrait sur le génie logiciel (SWE-bench Verified 74,4 contre 80,9 pour Opus 4.5 et 80,0 pour GPT-5.2), sur le code compétitif face à Gemini 3.0 Pro (86,4 contre 90,7) et sur τ²-Bench face à Opus 4.5 (88,2 contre 92,5). La moyenne de la sélection du billet est de 81,0, contre 80,6 à 82,2 pour les trois modèles fermés : c'est une moyenne choisie par l'éditeur, non un classement indépendant. L'écart de prix est important si les tarifs des agrégateurs sont exacts (0,10 et 0,30 dollar par million de tokens), mais les tarifs des trois modèles fermés ne sont pas relevés ici. Le modèle est utilisable localement sur du matériel haut de gamme, ce qui compte pour les usages où la donnée ne doit pas quitter l'entreprise. ### À retenir Step 3.5 Flash montre qu'un MoE à 11 milliards de paramètres actifs peut approcher les modèles fermés de début 2026 en raisonnement, avec une licence Apache 2.0 et un déploiement local possible. L'écart persiste sur le génie logiciel, selon les chiffres de l'éditeur.
Liens
Tags : LLM, Open Source, StepFun, Step, Apache 2.0, MoE, Agents