Tülu 3 405B

2025-01-30 · Éditeur : Ai2 · Domaine : Intelligence Artificielle

Ai2 publie Tülu 3 405B, un modèle issu de Llama 3.1 405B post-entraîné avec la recette ouverte Tülu 3 (SFT, DPO, RLVR), dont Ai2 affirme qu'il rivalise avec DeepSeek V3 et GPT-4o.

Ce qui change

  • Un post-entraînement en trois étapes : affinage supervisé, préférences directes (DPO) et apprentissage par renforcement avec récompenses vérifiables (RLVR).
  • Ai2 observe que le RLVR améliore davantage le score sur MATH à 405B qu'à 70B et 8B, ce qu'il rapproche des constats du rapport DeepSeek-R1.
  • Une performance annoncée comme compétitive ou supérieure à DeepSeek V3 et GPT-4o, et supérieure à Llama 3.1 405B Instruct et Nous Hermes 3 405B.
  • Une infrastructure documentée : 32 nœuds (256 GPU), inférence en parallélisme tensoriel 16 voies et 240 GPU supplémentaires pour l'entraînement.
  • Publication du code (open-instruct), des poids, des données et de la méthode d'évaluation.

Ai2 publie Tülu 3 405B, un modèle issu de Llama 3.1 405B post-entraîné avec la recette ouverte Tülu 3 (SFT, DPO, RLVR), dont Ai2 affirme qu'il rivalise avec DeepSeek V3 et GPT-4o. ### Contexte Tülu 3 avait été publié en novembre 2024 en tailles 8B et 70B. Ai2 applique la même recette au plus grand modèle Llama, en la présentant comme la première application de recettes de post-entraînement entièrement ouvertes à un modèle de cette taille. L'enjeu est de montrer qu'un post-entraînement ouvert peut se comparer à celui des modèles fermés. ### Ce que le modèle apporte - Un post-entraînement en trois étapes : affinage supervisé, préférences directes (DPO) et apprentissage par renforcement avec récompenses vérifiables (RLVR). - Ai2 observe que le RLVR améliore davantage le score sur MATH à 405B qu'à 70B et 8B, ce qu'il rapproche des constats du rapport DeepSeek-R1. - Une performance annoncée comme compétitive ou supérieure à DeepSeek V3 et GPT-4o, et supérieure à Llama 3.1 405B Instruct et Nous Hermes 3 405B. - Une infrastructure documentée : 32 nœuds (256 GPU), inférence en parallélisme tensoriel 16 voies et 240 GPU supplémentaires pour l'entraînement. - Publication du code (open-instruct), des poids, des données et de la méthode d'évaluation. ### Architecture et caractéristiques 405 milliards de paramètres, modèle de base Llama 3.1 405B de Meta. Licence : Llama 3.1 Community License (métadonnées HF), avec ses restrictions propres, à la différence de l'Apache 2.0 des modèles OLMo. Ouverture : le post-entraînement (données, code, recettes) est entièrement ouvert, mais le préentraînement de la base Llama ne l'est pas ; le modèle n'est donc pas entièrement ouvert au sens de l'OLMo. Contexte et date limite des données : non relevés. Poids sur Hugging Face, variantes SFT (10 janvier), DPO (28 janvier) et finale. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune API Ai2 pour ce modèle | | Matériel | Ai2 a utilisé 256 GPU pour l'entraînement ; besoin d'auto-hébergement non communiqué (405 milliards de paramètres, environ 810 Go en BF16, calcul) | ### Benchmarks Ai2 présente un tableau comparatif avec DeepSeek V3, GPT-4o et Llama 3.1 405B Instruct, mais il n'est diffusé que sous forme d'image sur la page : aucun chiffre n'a pu être extrait du texte. Les scores figurent dans le rapport arXiv 2411.15124. Source : billet Ai2 du 30 janvier 2025, comparaison publiée par Ai2, chiffres non relevés. ### Face aux modèles fermés Ai2 annonce des performances compétitives ou supérieures à celles de GPT-4o et de DeepSeek V3, sans que les chiffres aient pu être vérifiés ici. GPT-4o était alors un modèle fermé d'OpenAI ; l'écart n'est donc étayé que par la formulation de l'éditeur. Le point marquant est méthodologique : la recette de post-entraînement, les données et le code sont ouverts, ce qui permet de reproduire ou d'adapter le traitement. La dépendance à la licence Llama et au préentraînement de Meta limite la souveraineté sur le modèle de base. Le coût d'auto-hébergement d'un modèle de 405 milliards de paramètres reste très élevé. ### À retenir Tülu 3 405B démontre l'intérêt d'un post-entraînement ouvert à très grande échelle, mais reste un modèle à base Llama sous licence Llama.

Liens

Tags : LLM, Open Source, Poids ouverts, Ai2, Tülu 3, Post-entraînement ouvert, Llama 3.1 Community License