ERNIE 4.5

2025-06-30 · Éditeur : Baidu · Domaine : Intelligence Artificielle

Baidu ouvre toute la famille ERNIE 4.5 sous licence Apache 2.0 : dix modèles, du dense de 0,3 milliard aux MoE multimodaux à 47 milliards de paramètres actifs, le plus grand totalisant 424 milliards.

Ce qui change

  • MoE multimodal hétérogène : texte et vision sont entraînés ensemble, avec un routage isolé par modalité, une perte d'orthogonalité des routeurs et une perte d'équilibrage multimodal, pour qu'une modalité ne dégrade pas l'autre.
  • Efficacité d'entraînement : parallélisme hybride hétérogène, précision FP8 et recalcul fin, avec 47 % d'utilisation des FLOPs du modèle (MFU) sur 2 016 GPU NVIDIA H800 pour le plus grand modèle textuel.
  • Quantification quasi sans perte à 4 bits et 2 bits : 4 GPU de 80 Go en 4 bits, ou un GPU de 141 Go en 2 bits, pour le plus grand modèle ; débit annoncé de 56 000 tokens d'entrée et 18 000 tokens de sortie par seconde et par nœud H800.
  • Post-entraînement propre à chaque modalité : SFT, optimisation directe de préférences (DPO) ou une méthode de renforcement modifiée (UPO) ; les modèles de vision gèrent les modes avec et sans réflexion.
  • Baidu annonce que ERNIE-4.5-300B-A47B dépasse DeepSeek-V3 (671 milliards) sur 22 des 28 benchmarks, et que ERNIE-4.5-21B-A3B dépasse Qwen3-30B avec environ 30 % de paramètres en moins (annonces de l'éditeur).

Baidu ouvre toute la famille ERNIE 4.5 sous licence Apache 2.0 : dix modèles, du dense de 0,3 milliard aux MoE multimodaux à 47 milliards de paramètres actifs, le plus grand totalisant 424 milliards. ### Contexte Les modèles ERNIE étaient jusque-là proposés comme services fermés. En 2025, après DeepSeek-R1 et la vague de modèles ouverts chinois, Baidu ouvre à son tour la famille ERNIE 4.5 le 30 juin, quelques jours après Tencent. La référence fermée comparée est GPT-4.1, la référence ouverte DeepSeek-V3-0324 et Qwen3-235B-A22B. ### Ce que le modèle apporte - MoE multimodal hétérogène : texte et vision sont entraînés ensemble, avec un routage isolé par modalité, une perte d'orthogonalité des routeurs et une perte d'équilibrage multimodal, pour qu'une modalité ne dégrade pas l'autre. - Efficacité d'entraînement : parallélisme hybride hétérogène, précision FP8 et recalcul fin, avec 47 % d'utilisation des FLOPs du modèle (MFU) sur 2 016 GPU NVIDIA H800 pour le plus grand modèle textuel. - Quantification quasi sans perte à 4 bits et 2 bits : 4 GPU de 80 Go en 4 bits, ou un GPU de 141 Go en 2 bits, pour le plus grand modèle ; débit annoncé de 56 000 tokens d'entrée et 18 000 tokens de sortie par seconde et par nœud H800. - Post-entraînement propre à chaque modalité : SFT, optimisation directe de préférences (DPO) ou une méthode de renforcement modifiée (UPO) ; les modèles de vision gèrent les modes avec et sans réflexion. - Baidu annonce que ERNIE-4.5-300B-A47B dépasse DeepSeek-V3 (671 milliards) sur 22 des 28 benchmarks, et que ERNIE-4.5-21B-A3B dépasse Qwen3-30B avec environ 30 % de paramètres en moins (annonces de l'éditeur). ### Architecture et caractéristiques - Famille : 10 variantes, dont ERNIE-4.5-300B-A47B (texte), ERNIE-4.5-21B-A3B (texte), ERNIE-4.5-0.3B (dense), ERNIE-4.5-VL-424B-A47B et ERNIE-4.5-VL-28B-A3B (vision-langage). - ERNIE-4.5-300B-A47B : 300 milliards de paramètres au total, 47 milliards actifs, 54 couches, 64 experts de texte (8 actifs) et 64 experts de vision (8 actifs), contexte de 131 072 tokens. - Langues : anglais et chinois. Données d'entraînement et coupure des connaissances : non communiquées dans les sources consultées. - Licence : Apache 2.0 (usage commercial libre). Poids : versions PyTorch (-PT) et PaddlePaddle (-Paddle) sur Hugging Face, GitHub et Baidu AI Studio. ### Coût et accès Aucun tarif d'API n'a été consulté pour ERNIE 4.5. Pour l'auto-hébergement du plus grand modèle, le rapport technique indique 4 GPU de 80 Go avec quantification 4 bits ou 1 GPU de 141 Go avec quantification 2 bits. | Poste | Information | | --- | --- | | API officielle Baidu | Tarif non consulté | | Plus grand modèle, 4 bits | 4 GPU de 80 Go | | Plus grand modèle, 2 bits | 1 GPU de 141 Go | | Licence | Apache 2.0 | ### Benchmarks | Benchmark | ERNIE-4.5-300B-A47B | GPT-4.1 | DeepSeek-V3-0324 (ouvert) | Qwen3-235B-A22B (ouvert) | | --- | --- | --- | --- | --- | | MMLU | 86,5 | 90,2 | 86,5 | 85,5 | | MMLU-Pro | 78,4 | 80,7 | 81,2 | 72,9 | | SimpleQA | 45,9 | 40,2 | 27,3 | 12,4 | | ChineseSimpleQA | 77,1 | 64,0 | 72,0 | 63,0 | | MATH-500 | 96,4 | 92,8 | 94,0 | 91,2 | | AIME 2024 | 54,8 | 48,1 | 59,4 | 40,1 | | AIME 2025 | 35,1 | 36,7 | 47,7 | 24,7 | | LiveCodeBench | 38,8 | 40,5 | 45,4 | 36,1 | | IFEval | 88,0 | 87,4 | 82,3 | 83,2 | | Multi-IF | 76,6 | 70,8 | 66,9 | 70,2 | Source : rapport technique ERNIE 4.5, tableau 5 (29 juin 2025). Scores mesurés par Baidu. Pour la vision en mode réflexion (tableau 8 du même rapport), OpenAI o1 obtient 71,4 à MathVista, 77,7 à MMMU et 81,0 à DocVQA, contre 78,9, 70,0 et 93,1 pour ERNIE-4.5-VL-424B-A47B. ### Face aux modèles fermés Face à GPT-4.1, ERNIE-4.5-300B-A47B est devant sur les connaissances factuelles (SimpleQA 45,9 contre 40,2 ; ChineseSimpleQA 77,1 contre 64,0), en mathématiques à MATH-500 (96,4 contre 92,8) et sur le suivi d'instructions (Multi-IF 76,6 contre 70,8). Il est derrière sur MMLU (86,5 contre 90,2), MMLU-Pro (78,4 contre 80,7), AIME 2025 (35,1 contre 36,7) et LiveCodeBench (38,8 contre 40,5). Baidu écrit que les résultats en mathématiques et en code sont comparables à ceux de GPT-4.1 et de DeepSeek-V3-0324, et que des progrès restent possibles sur les tâches difficiles. En vision avec réflexion, le plus grand modèle dépasse OpenAI o1 sur MathVista, DocVQA et ChartQA mais reste derrière à MMMU (70,0 contre 77,7). GPT-4.1 est un modèle non raisonneur du printemps 2025 : le tableau n'indique rien des modèles de raisonnement fermés. Aucun tarif n'est disponible pour comparer les coûts. Le choix ouvert prend son sens par la licence Apache 2.0 sur toute la gamme, la présence de petits modèles exploitables en interne et la quantification annoncée à 2 et 4 bits. ### À retenir ERNIE 4.5 est l'entrée de Baidu dans l'ouvert : une famille complète sous Apache 2.0, avec des résultats de l'éditeur proches de GPT-4.1 et DeepSeek-V3-0324. Sa force est la gamme, qui va du 0,3B au MoE multimodal, et l'outillage de quantification et de déploiement publié avec.

Liens

Tags : LLM, Open Source, Baidu, ERNIE, Apache 2.0, MoE, Multimodal