Step 3.7 Flash
2026-05-29 · Éditeur : StepFun · Domaine : Intelligence Artificielle
StepFun publie Step 3.7 Flash, un modèle vision-langage à experts de 198 milliards de paramètres dont 11 milliards actifs, sous Apache 2.0, avec 256 000 tokens de contexte et jusqu'à 400 tokens par seconde.
Ce qui change
- Vision native : encodeur de 1,8 milliard de paramètres ; 79,2 à SimpleVQA (Search), premier rang selon la fiche, et 95,3 à V* (Python), niveau de pointe.
- Trois niveaux de réflexion (faible, moyen, élevé) pour arbitrer entre vitesse, coût et profondeur.
- Agents : 67,1 à ClawEval-1.1, devant le concurrent suivant (59,8 selon la fiche), 49,5 à Toolathlon et 48,1 à Humanity's Last Exam avec outils.
- Code : 56,3 à SWE-Bench Pro, deuxième rang de la sélection de la fiche ; Terminal-Bench 2.1 à 59,5 et GDPVal-AA à 45,8 sont signalés comme axes d'amélioration.
- Mode « Advisor » décrit dans le billet : un exécuteur léger consulte un modèle de pointe aux moments critiques, pour un coût de 0,19 dollar par tâche contre 1,76 dollar pour Claude Opus 4.6 sur SWE-Bench Verified (annonce de l'éditeur).
StepFun publie Step 3.7 Flash, un modèle vision-langage à experts de 198 milliards de paramètres dont 11 milliards actifs, sous Apache 2.0, avec 256 000 tokens de contexte et jusqu'à 400 tokens par seconde. ### Contexte Step 3.7 Flash arrive quatre mois après Step 3.5 Flash. Il ajoute la vision native à la même base de 196 milliards de paramètres de langage et cible les agents qui combinent perception, recherche et raisonnement, avec des charges de production fréquentes : lecture de rapports financiers, boucles de recherche et agents de code concurrents. ### Ce que le modèle apporte - Vision native : encodeur de 1,8 milliard de paramètres ; 79,2 à SimpleVQA (Search), premier rang selon la fiche, et 95,3 à V* (Python), niveau de pointe. - Trois niveaux de réflexion (faible, moyen, élevé) pour arbitrer entre vitesse, coût et profondeur. - Agents : 67,1 à ClawEval-1.1, devant le concurrent suivant (59,8 selon la fiche), 49,5 à Toolathlon et 48,1 à Humanity's Last Exam avec outils. - Code : 56,3 à SWE-Bench Pro, deuxième rang de la sélection de la fiche ; Terminal-Bench 2.1 à 59,5 et GDPVal-AA à 45,8 sont signalés comme axes d'amélioration. - Mode « Advisor » décrit dans le billet : un exécuteur léger consulte un modèle de pointe aux moments critiques, pour un coût de 0,19 dollar par tâche contre 1,76 dollar pour Claude Opus 4.6 sur SWE-Bench Verified (annonce de l'éditeur). ### Architecture et caractéristiques - Architecture : MoE vision-langage de 198 milliards de paramètres (196 milliards de langage et 1,8 milliard de vision), environ 11 milliards actifs. - Contexte : 256 000 tokens. Débit : jusqu'à 400 tokens par seconde. Modalités : texte et image. - Licence : Apache 2.0 (usage commercial libre). - Poids : stepfun-ai/Step-3.7-Flash sur Hugging Face (et GGUF) ; API sur platform.stepfun.ai, OpenRouter et NVIDIA NIM. Coupure des connaissances : non communiquée. ### Coût et accès Tarifs de l'API officielle de StepFun, selon la fiche : 0,20 dollar par million de tokens en entrée (cache manqué), 0,04 dollar en entrée avec cache et 1,15 dollar en sortie. Pour l'auto-hébergement, StepFun cite des machines à mémoire unifiée d'au moins 128 Go (Mac Studio, MacBook Pro, AMD Ryzen AI Max+ 395, NVIDIA DGX Station) et un déploiement en centre de données. | Poste | Prix (USD par million de tokens) | | --- | --- | | Entrée (cache manqué) | 0,20 | | Entrée (cache atteint) | 0,04 | | Sortie | 1,15 | ### Benchmarks | Indicateur | Step 3.7 Flash | Rang ou comparaison publiés | | --- | --- | --- | | SWE-Bench Pro | 56,3 | Deuxième rang de la sélection ; GPT-5.5 : 58,6 (billet, via résumé de page) | | ClawEval-1.1 | 67,1 | Premier rang ; concurrent suivant : 59,8 | | SimpleVQA (Search) | 79,2 | Premier rang | | V* (Python) | 95,3 | Parité avec la pointe | | Terminal-Bench 2.1 | 59,5 | Axe d'amélioration signalé | | GDPVal-AA | 45,8 | Axe d'amélioration signalé | | Toolathlon | 49,5 | Non précisé | | Humanity's Last Exam (avec outils) | 48,1 | Non précisé | Source : fiche Hugging Face de Step 3.7 Flash (scores de l'éditeur) ; comparaison à GPT-5.5 issue du billet StepFun d'après un résumé de page. Aucun tableau de modèles fermés n'est repris en entier faute de source stable. ### Face aux modèles fermés La seule comparaison avec un modèle fermé retenue ici est SWE-Bench Pro : 56,3 pour Step 3.7 Flash contre 58,6 pour GPT-5.5, soit un écart de 2,3 points, valeur de GPT-5.5 recoupée avec la fiche LongCat-2.0. Sur Terminal-Bench 2.1, Step 3.7 Flash à 59,5 est nettement en retrait de GPT-5.5 (73,8 dans la fiche LongCat-2.0, valeur citée depuis un rapport officiel), et StepFun le reconnaît comme un axe d'amélioration. Les scores de tête de la fiche (ClawEval-1.1, SimpleVQA) portent sur une cohorte choisie par l'éditeur, non un classement indépendant. Le prix de sortie de 1,15 dollar par million de tokens doit être rapproché des tarifs des modèles fermés de pointe, qui ne sont pas relevés dans cette fiche. Pour un choix ouvert ou fermé, l'atout est un modèle multimodal léger (11 milliards de paramètres actifs) sous Apache 2.0, déployable sur des machines à 128 Go de mémoire. ### À retenir Step 3.7 Flash ajoute la vision et des niveaux de réflexion à un MoE léger, avec un tarif de sortie de 1,15 dollar. Il est proche des modèles fermés sur SWE-Bench Pro mais nettement derrière sur Terminal-Bench, selon les chiffres de l'éditeur et d'un tiers cité.
Liens
Tags : LLM, Open Source, StepFun, Step, Apache 2.0, MoE, Multimodal