SERA (agents de code ouverts 8B, 14B, 32B)
2026-01-27 · Éditeur : Ai2 · Domaine : Intelligence Artificielle
Ai2 publie SERA, une famille d'agents de code ouverts (8B, 14B, 32B, base Qwen 3) avec poids, code, données synthétiques et une CLI, entraînés à faible coût grâce à une génération de données à vérification souple.
Ce qui change
- La « soft-verified generation » : entraîner sur des données partiellement correctes évite la vérification complète, coûteuse, tout en gardant l'efficacité, selon Ai2.
- SERA-32B résout 54,2 % de SWE-Bench Verified à 64K de contexte et 49,5 % à 32K.
- Ai2 le juge compétitif avec Devstral Small 2 et GLM-4.5-Air à réglages comparables.
- Un coût annoncé d'environ 400 dollars pour reproduire les meilleurs résultats ouverts précédents et d'environ 12 000 dollars pour égaler Devstral Small 2, soit environ 40 jours de GPU sur 2 GPU Hopper.
- Une spécialisation par dépôt : 52,23 % sur Django et 51,11 % sur SymPy.
Ai2 publie SERA, une famille d'agents de code ouverts (8B, 14B, 32B, base Qwen 3) avec poids, code, données synthétiques et une CLI, entraînés à faible coût grâce à une génération de données à vérification souple. ### Contexte Les agents de code performants reposent en général sur des données d'entraînement coûteuses à vérifier. Ai2 propose une méthode de génération synthétique où les trajectoires n'ont pas besoin d'être entièrement correctes, et publie la recette. ### Ce que le modèle apporte - La « soft-verified generation » : entraîner sur des données partiellement correctes évite la vérification complète, coûteuse, tout en gardant l'efficacité, selon Ai2. - SERA-32B résout 54,2 % de SWE-Bench Verified à 64K de contexte et 49,5 % à 32K. - Ai2 le juge compétitif avec Devstral Small 2 et GLM-4.5-Air à réglages comparables. - Un coût annoncé d'environ 400 dollars pour reproduire les meilleurs résultats ouverts précédents et d'environ 12 000 dollars pour égaler Devstral Small 2, soit environ 40 jours de GPU sur 2 GPU Hopper. - Une spécialisation par dépôt : 52,23 % sur Django et 51,11 % sur SymPy. ### Architecture et caractéristiques Modèles 8B, 14B et 32B sur base Qwen 3, entraînés jusqu'à 32K de contexte (SERA-32B évalué aussi à 64K et plus). Licence : Apache 2.0 (fiche HF du 32B). Ouverture : poids, code d'entraînement et recettes, jeux de données synthétiques au format indépendant du modèle, outil en ligne de commande SERA CLI (PyPI) avec intégration Claude Code. Le préentraînement de la base Qwen 3 n'est pas ouvert : recette de post-entraînement ouverte, pas modèle entièrement ouvert. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune ; CLI et poids ouverts | | Matériel d'entraînement | Environ 40 jours de GPU sur 2 GPU Hopper pour reproduire l'état de l'art ouvert | | Poids | SERA-32B, 8B (27 janvier 2026), 14B (3 février 2026) | ### Benchmarks | SWE-Bench Verified (Ai2) | Taux de résolution | |---|---| | SERA-32B, contexte 64K | 54,2 % | | SERA-32B, contexte 32K | 49,5 % | Source : billet Ai2 du 27 janvier 2026, mesures Ai2 ; les comparaisons avec Devstral Small 2 et GLM-4.5-Air (ouverts) sont qualitatives dans l'extrait consulté. ### Face aux modèles fermés Aucun modèle fermé n'est comparé dans les sources consultées. Le positionnement est celui d'une recette reproductible et peu coûteuse plutôt que d'un modèle de pointe : les résultats sont comparés à des modèles ouverts de code (Devstral Small 2, GLM-4.5-Air). Un score de 54,2 % sur SWE-Bench Verified est mesuré par Ai2 et n'est pas relié ici à un score fermé sur la même période. L'atout pour une entreprise est de pouvoir spécialiser un petit agent sur son propre dépôt à un coût annoncé de quelques centaines à quelques milliers de dollars. Cela répond à un besoin de souveraineté du code, que les modèles fermés d'API ne couvrent pas. ### À retenir SERA rend accessible l'entraînement d'agents de code spécialisés. Les chiffres de coût et de score sont ceux d'Ai2.
Liens
Tags : LLM, Open Source, Poids, code et données ouverts, Ai2, SERA, Agents de code, Apache 2.0