Step3

2025-07-31 · Éditeur : StepFun · Domaine : Intelligence Artificielle

StepFun ouvre Step3, un modèle multimodal à experts de 321 milliards de paramètres dont 38 actifs, sous Apache 2.0, conçu avec son système d'inférence pour réduire le coût du décodage sur des GPU variés.

Ce qui change

  • Attention à factorisation multi-matrices (MFA) : selon le rapport, elle ne réduit que d'environ 10 % le volume d'accès mémoire au cache clé-valeur par rapport à l'attention latente (MLA) de DeepSeek-V3, mais le coût d'attention estimé (tableau 6) est réduit de moitié ou plus dans de nombreux cas, g…
  • Désagrégation attention-FFN (AFD) : les couches d'attention et les couches d'experts tournent sur des groupes de GPU distincts, ce qui permet de choisir un matériel adapté à chaque partie, y compris des cartes moins chères que le H800.
  • Débit annoncé : 4 039 tokens par GPU et par seconde en décodage sur des GPU Hopper, à 4 096 tokens de contexte moyen et sous un objectif de 20 tokens par seconde par requête, soit environ 74 % de plus que la référence DeepSeek-V3 selon le rapport.
  • Modèle multimodal : le modèle de langage est associé à un encodeur de vision, pour un total de 321 milliards de paramètres.
  • Bibliothèque de communication StepMesh publiée pour l'AFD (GitHub).

StepFun ouvre Step3, un modèle multimodal à experts de 321 milliards de paramètres dont 38 actifs, sous Apache 2.0, conçu avec son système d'inférence pour réduire le coût du décodage sur des GPU variés. ### Contexte À l'été 2025, le coût de l'inférence des grands MoE est devenu un sujet central : DeepSeek-V3 a publié un système de déploiement distribué de référence, que StepFun prend comme point de comparaison. StepFun, jeune entreprise chinoise spécialisée dans les modèles multimodaux, publie avec Step3 à la fois un modèle et l'architecture de serveur qui va avec. ### Ce que le modèle apporte - Attention à factorisation multi-matrices (MFA) : selon le rapport, elle ne réduit que d'environ 10 % le volume d'accès mémoire au cache clé-valeur par rapport à l'attention latente (MLA) de DeepSeek-V3, mais le coût d'attention estimé (tableau 6) est réduit de moitié ou plus dans de nombreux cas, grâce à une intensité arithmétique mieux équilibrée. - Désagrégation attention-FFN (AFD) : les couches d'attention et les couches d'experts tournent sur des groupes de GPU distincts, ce qui permet de choisir un matériel adapté à chaque partie, y compris des cartes moins chères que le H800. - Débit annoncé : 4 039 tokens par GPU et par seconde en décodage sur des GPU Hopper, à 4 096 tokens de contexte moyen et sous un objectif de 20 tokens par seconde par requête, soit environ 74 % de plus que la référence DeepSeek-V3 selon le rapport. - Modèle multimodal : le modèle de langage est associé à un encodeur de vision, pour un total de 321 milliards de paramètres. - Bibliothèque de communication StepMesh publiée pour l'AFD (GitHub). ### Architecture et caractéristiques - Architecture : MoE de 316 milliards de paramètres pour la partie langage (321 milliards avec la vision), 38 milliards actifs ; 61 couches dont 5 denses, dimension cachée de 7 168, attention MFA à 64 têtes de requête. - Experts : 48 experts routés, 3 sélectionnés par token, plus 1 expert partagé. Tokenizer : celui de DeepSeek V3. - Contexte : 65 536 tokens maximum. Modalités : texte et image. Précision publiée : BF16 (et version FP8 par blocs). - Licence : Apache 2.0. Poids : stepfun-ai/step3 et step3-fp8 sur Hugging Face et ModelScope. Coupure des connaissances et langues : non communiquées. ### Coût et accès Un accès par API est proposé sur la plateforme de StepFun, mais aucun tarif n'a été consulté. Le rapport système décrit des déploiements de 32 à 48 GPU Hopper en mode AFD (par exemple 2 GPU d'attention pour 2 GPU de FFN par groupe) et recommande des cartes au moins aussi puissantes que le NVIDIA L20 pour la partie attention. | Configuration (contexte moyen) | GPU Hopper | Débit maximal (tokens par GPU et par seconde) | | --- | --- | --- | | DeepSeek-V3, blog officiel (4 989) | 144 | 1 850 | | DeepSeek-V3, mesure de profilage (4 096) | 128 | 2 324 | | Step3, attention BF16 (4 096) | 40 | 3 321 | | Step3, attention FP8 (4 096) | 32 | 4 039 | | Step3, attention FP8 (8 192) | 48 | 2 643 | ### Benchmarks | Mesure | Step3 | DeepSeek-V3 | Qwen3 MoE | | --- | --- | --- | --- | | Débit maximal en décodage (tokens/GPU/s, objectif 20 tokens/s par requête) | 4 039 | 1 850 (blog) ou 2 324 (profilage) | Non mesuré | | Coût théorique de décodage à 8K de contexte (USD par million de tokens) | 0,055 | 0,068 | 0,062 | | Coût théorique de décodage à 32K de contexte (USD par million de tokens) | 0,129 | 0,211 | 0,193 | Source : rapport StepFun arXiv 2507.19427, tableau 8, §7.3 et observation 1 du §4.2 (coûts théoriques, estimations analytiques de StepFun, non mesurées). Mesures de StepFun ; les chiffres de DeepSeek-V3 sont ceux que DeepSeek a publiés (blog et profilage). Les scores de capacité de la fiche sont dans une image : non repris. Aucune comparaison avec un modèle fermé. ### Face aux modèles fermés Le rapport ne compare pas Step3 à des modèles fermés : il cible le coût de décodage et le mesure face à DeepSeek-V3, un modèle ouvert. Sur ce point, StepFun revendique 4 039 tokens par GPU et par seconde contre 1 850 (blog) ou 2 324 (profilage) pour DeepSeek-V3 dans des conditions décrites comme similaires, en reconnaissant que DeepSeek-V3 pourrait être optimisé davantage (quantification, noyaux) ; ce sont des mesures de l'éditeur. La comparaison des capacités avec les modèles fermés de l'époque n'est pas disponible en texte : elle figure dans une image de la fiche. Le prix n'étant pas relevé, l'écart de coût avec les modèles fermés n'est pas établi. L'intérêt pour un choix ouvert ou fermé est architectural : un modèle multimodal de 38 milliards de paramètres actifs sous Apache 2.0, pensé pour être servi sur des GPU de gamme mixte, ce qui compte pour l'auto-hébergement à l'échelle. ### À retenir Step3 est un jalon de conception conjointe modèle et infrastructure : MFA et AFD visent à baisser le coût de décodage. Ses gains sont mesurés face à DeepSeek-V3 et non face aux modèles fermés, dont la comparaison manque en texte.

Liens

Tags : LLM, Open Source, StepFun, Step, Apache 2.0, MoE, Multimodal