gpt-oss-safeguard
2025-10-29 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
OpenAI publie en aperçu gpt-oss-safeguard-120b et 20b, des modèles de raisonnement à poids ouverts qui classent des contenus selon une politique de sécurité fournie par le développeur à l'inférence.
Ce qui change
- Versions affinées de gpt-oss, sous licence Apache 2.0, pour des tâches de classification de sécurité.
- Le modèle reçoit deux entrées, une politique et le contenu à classer, et renvoie sa conclusion avec son raisonnement.
- La politique n'est pas entraînée dans le modèle : on peut la modifier sans réentraîner de classifieur.
- Issu de l'outil interne Safety Reasoner, développé avec ROOST, qui lance une communauté autour des modèles ouverts de sécurité.
OpenAI publie en aperçu gpt-oss-safeguard-120b et 20b, des modèles de raisonnement à poids ouverts qui classent des contenus selon une politique de sécurité fournie par le développeur à l'inférence. ### Ce qui change - Versions affinées de gpt-oss, sous licence Apache 2.0, pour des tâches de classification de sécurité. - Le modèle reçoit deux entrées, une politique et le contenu à classer, et renvoie sa conclusion avec son raisonnement. - La politique n'est pas entraînée dans le modèle : on peut la modifier sans réentraîner de classifieur. - Issu de l'outil interne Safety Reasoner, développé avec ROOST, qui lance une communauté autour des modèles ouverts de sécurité. ### Caractéristiques - Deux tailles : gpt-oss-safeguard-120b et gpt-oss-safeguard-20b, poids téléchargeables sur Hugging Face. - Chaîne de pensée consultable par le développeur pour expliquer chaque décision. - Contexte, sortie maximale et coupure : non détaillés dans le billet (hérités de gpt-oss). ### Tarifs Poids libres sous licence Apache 2.0, sans tarif OpenAI. ### Benchmarks Scores publiés par l'éditeur, sous forme qualitative : sur une évaluation interne multi-politiques, gpt-oss-safeguard et le Safety Reasoner interne dépassent gpt-5-thinking et gpt-oss en précision. Sur le jeu de modération de 2022, gpt-oss-safeguard est légèrement au-dessus des autres modèles testés, sans écart statistiquement significatif avec le Safety Reasoner. Les valeurs chiffrées sont dans le rapport technique. ### À retenir Utile aux plateformes qui doivent appliquer leurs propres règles de modération, avec un coût de calcul et une latence supérieurs à ceux d'un classifieur classique.
Liens
Tags : Open Source, LLM, OpenAI, Sécurité, gpt-oss, Modération