Llama 3.1 405B : un modèle ouvert au niveau des meilleurs modèles fermés

2024-07-23 · Éditeur : Meta · Domaine : Intelligence Artificielle

Meta publie Llama 3.1, dont la version 405B est le premier modèle à poids ouverts présenté au niveau de GPT-4o et de Claude 3.5 Sonnet. L'écart entre modèles ouverts et fermés se réduit nettement.

Ce qui change

  • Trois tailles (8B, 70B et 405B) avec une fenêtre de contexte portée à 128 000 tokens et huit langues prises en charge.
  • Le 405B est entraîné sur plus de 15 000 milliards de tokens avec plus de 16 000 GPU H100.
  • Meta le compare à GPT-4o et Claude 3.5 Sonnet en raisonnement, mathématiques, code et appel d'outils.
  • La licence autorise désormais à utiliser les sorties du modèle pour améliorer d'autres modèles (données synthétiques, distillation).
  • Plus de 25 partenaires (AWS, Nvidia, Databricks, Google Cloud, Snowflake, etc.) le proposent dès le premier jour.

Le 23 juillet 2024, Meta publie la famille Llama 3.1, dont un modèle de 405 milliards de paramètres. Pour la première fois, un modèle dont les poids sont téléchargeables est présenté comme rivalisant avec les meilleurs modèles propriétaires du moment. Le même jour, Mark Zuckerberg publie une lettre intitulée « Open Source AI Is the Path Forward » (l'IA open source est la voie à suivre). ### Ce qui s'est passé - Trois modèles : 405B, le modèle phare, et des versions 8B et 70B mises à jour. - Contexte étendu à 128 000 tokens et prise en charge de huit langues, dont le français. - Architecture de transformeur décodeur classique, sans mélange d'experts, avec un post-entraînement itératif (ajustement supervisé, échantillonnage par rejet, optimisation directe des préférences). - Meta publie aussi Llama Guard 3 (modèle de sécurité multilingue) et Prompt Guard (filtre contre l'injection de requêtes). ### Chiffres clés | Élément | Valeur | |---|---| | Paramètres du modèle phare | 405 milliards | | Données d'entraînement | plus de 15 000 milliards de tokens | | GPU utilisés | plus de 16 000 H100 | | Fenêtre de contexte | 128 000 tokens | | Partenaires au lancement | plus de 25 | ### Pourquoi c'est un tournant Meta qualifie le 405B de « first frontier-level open source AI model » (premier modèle d'IA open source de niveau frontière). Une entreprise peut désormais héberger chez elle, ou chez le fournisseur de son choix, un modèle de premier plan, l'adapter à ses données et s'en servir pour générer des données synthétiques ou entraîner des modèles plus petits. La licence ouvre explicitement cet usage, jusque-là interdit. ### Réserves Les poids sont ouverts, mais la licence Llama n'est pas une licence open source au sens de l'Open Source Initiative : elle impose des conditions d'usage et un accord spécifique au-delà de 700 millions d'utilisateurs actifs mensuels. Les données d'entraînement ne sont pas publiées. Faire tourner le 405B exige une infrastructure GPU conséquente, hors de portée de la plupart des postes de travail. ### À retenir Llama 3.1 405B montre qu'un modèle à poids ouverts peut approcher l'état de l'art. Pour les entreprises, c'est une option crédible de souveraineté et de maîtrise des coûts face aux API fermées.

Liens

Tags : IA, Open Source, LLM, Meta, Llama