Seed-OSS-36B

2025-08-20 · Éditeur : ByteDance · Domaine : Intelligence Artificielle

ByteDance publie Seed-OSS-36B, son premier grand modèle généraliste à poids ouverts : un dense de 36 milliards de paramètres, contexte natif de 512 000 tokens et budget de réflexion réglable, sous Apache 2.0.

Ce qui change

  • Budget de réflexion réglable : l'utilisateur fixe la longueur du raisonnement ; le modèle s'auto-évalue périodiquement (par exemple avec un budget de 512 tokens il indique les tokens consommés et restants) et conclut quand le budget est épuisé.
  • Contexte natif de 512 000 tokens : score de 94,6 à RULER à 128 000 tokens, à égalité avec Seed1.6-Thinking-0715 et Qwen3-30B-A3B-Thinking-2507 (94,5).
  • Efficacité en données : entraîné sur seulement 12 000 milliards de tokens, selon la fiche.
  • Base de recherche : deux versions de base, avec et sans données d'instructions synthétiques dans le pré-entraînement, pour que la recherche sur le post-entraînement ne soit pas biaisée.
  • Agents : 56 à SWE-Bench Verified (OpenHands), contre 31 pour Qwen3-30B-A3B-Thinking et 23,4 pour Qwen3-32B, et 70,4 à TAU1-Retail.

ByteDance publie Seed-OSS-36B, son premier grand modèle généraliste à poids ouverts : un dense de 36 milliards de paramètres, contexte natif de 512 000 tokens et budget de réflexion réglable, sous Apache 2.0. ### Contexte En août 2025, l'ouvert chinois est dominé par les MoE (Qwen3, DeepSeek, Kimi K2) et OpenAI vient d'ouvrir gpt-oss. ByteDance, jusque-là connu pour des modèles ouverts spécialisés (agents d'interface UI-TARS, code Seed-Coder, image BAGEL), publie avec son équipe Seed un modèle généraliste. Il est dense plutôt que MoE et optimisé en priorité pour un usage international, précise la fiche. ### Ce que le modèle apporte - Budget de réflexion réglable : l'utilisateur fixe la longueur du raisonnement ; le modèle s'auto-évalue périodiquement (par exemple avec un budget de 512 tokens il indique les tokens consommés et restants) et conclut quand le budget est épuisé. - Contexte natif de 512 000 tokens : score de 94,6 à RULER à 128 000 tokens, à égalité avec Seed1.6-Thinking-0715 et Qwen3-30B-A3B-Thinking-2507 (94,5). - Efficacité en données : entraîné sur seulement 12 000 milliards de tokens, selon la fiche. - Base de recherche : deux versions de base, avec et sans données d'instructions synthétiques dans le pré-entraînement, pour que la recherche sur le post-entraînement ne soit pas biaisée. - Agents : 56 à SWE-Bench Verified (OpenHands), contre 31 pour Qwen3-30B-A3B-Thinking et 23,4 pour Qwen3-32B, et 70,4 à TAU1-Retail. ### Architecture et caractéristiques - Architecture : modèle dense de 36 milliards de paramètres, 64 couches, attention par groupes de requêtes (80 têtes de requête, 8 têtes clé et valeur), taille de tête 128, taille cachée 5 120, RoPE, RMSNorm et SwiGLU. - Vocabulaire : 155 000 tokens. Contexte : 512 000 tokens. Entraînement : 12 000 milliards de tokens. Modalités : texte. - Licence : Apache 2.0 (usage commercial libre). - Poids : Seed-OSS-36B-Instruct, Seed-OSS-36B-Base et Seed-OSS-36B-Base-woSyn sur Hugging Face ; compatible vLLM. Coupure des connaissances : non communiquée. ### Coût et accès Aucune API dédiée ni tarif n'a été consulté pour Seed-OSS. Pour l'auto-hébergement, la fiche fournit une commande vLLM avec parallélisme tensoriel 8 et propose des options de quantification 4 bits et 8 bits ; elle ne fixe pas de configuration minimale. | Poste | Information | | --- | --- | | API officielle | Non consultée | | Auto-hébergement | Modèle dense de 36 milliards de paramètres ; exemple vLLM avec tp 8 ; quantification 4 et 8 bits possible | | Licence | Apache 2.0 | ### Benchmarks | Benchmark | Seed-OSS-36B-Instruct | Seed1.6-Thinking-0715 | OAI-OSS-20B (ouvert) | Qwen3-30B-A3B-Thinking-2507 (ouvert) | | --- | --- | --- | --- | --- | | MMLU-Pro | 82,7 | 86,6 | 76,2 | 81,9 | | GPQA-Diamond | 71,4 | 80,7 | 72,2 | 71,4 | | AIME 2024 | 91,7 | 90,3 | 92,7 | 87,7 | | AIME 2025 | 84,7 | 86,0 | 90,3 | 81,3 | | LiveCodeBench v6 | 67,4 | 66,8 | 63,8 | 60,3 | | SWE-Bench Verified (OpenHands) | 56,0 | 41,8 | 60,7 | 31,0 | | TAU1-Retail | 70,4 | 63,0 | 54,8 | 58,7 | | RULER (128K) | 94,6 | 94,5 | 78,7 | 94,5 | Source : fiche Hugging Face de Seed-OSS-36B-Instruct. Scores publiés par l'équipe Seed ; les chiffres d'autres éditeurs sont repris de rapports publics selon la fiche. Premier chiffre retenu lorsque la fiche en donne deux. ### Face aux modèles fermés Dans le tableau de la fiche, le seul modèle fermé est Seed1.6-Thinking-0715 de ByteDance lui-même : Seed-OSS-36B-Instruct le dépasse à l'AIME 2024 (91,7 contre 90,3), à LiveCodeBench v6 (67,4 contre 66,8), à SWE-Bench Verified (56,0 contre 41,8) et à TAU1-Retail (70,4 contre 63,0), mais reste derrière sur les connaissances (MMLU-Pro 82,7 contre 86,6 ; GPQA-Diamond 71,4 contre 80,7). Aucun modèle fermé d'OpenAI, Anthropic ou Google n'est dans la comparaison. Face à gpt-oss-20b, ouvert, il est devant en RULER et TAU1-Retail mais derrière en SWE-Bench Verified et à l'AIME 2025. L'écart de prix n'est pas chiffrable. Pour l'entreprise, l'intérêt est un dense de taille moyenne sous Apache 2.0, avec un budget de réflexion qui permet de plafonner le coût de génération. ### À retenir Seed-OSS-36B est un modèle généraliste ouvert de ByteDance qui privilégie le contrôle du raisonnement et le contexte long plutôt que la taille. Il n'est pas comparé aux grands modèles fermés américains dans la fiche, ce qui limite l'évaluation de son niveau relatif.

Liens

Tags : LLM, Open Source, ByteDance, Seed, Apache 2.0, Contexte 512K, Budget de réflexion