ERNIE-4.5-VL-28B-A3B-Thinking

2025-11-11 · Éditeur : Baidu · Domaine : Intelligence Artificielle

Baidu publie ERNIE-4.5-VL-28B-A3B-Thinking, un modèle vision-langage de 28 milliards de paramètres dont 3 milliards actifs, sous licence Apache 2.0, qui raisonne sur les images et tient sur un seul GPU de 80 Go.

Ce qui change

  • Raisonnement visuel multi-étapes : analyse de graphiques, raisonnement causal et STEM à partir de photos d'énoncés, grâce à un apprentissage par renforcement sur tâches vérifiables (GSPO et IcePop pour stabiliser l'entraînement des MoE, avec échantillonnage dynamique par difficulté).
  • « Penser avec les images » : le modèle peut zoomer sur une image et rechercher des images via des outils pour lever une ambiguïté.
  • Ancrage visuel (grounding) renforcé et meilleur suivi d'instructions pour des scénarios industriels.
  • Appel d'outils et recherche d'images pour identifier les connaissances de longue traîne.
  • Compréhension vidéo : repérage d'événements et de changements sur différents segments temporels. La fiche insiste sur la conscience temporelle et la localisation d'événements dans les vidéos.

Baidu publie ERNIE-4.5-VL-28B-A3B-Thinking, un modèle vision-langage de 28 milliards de paramètres dont 3 milliards actifs, sous licence Apache 2.0, qui raisonne sur les images et tient sur un seul GPU de 80 Go. ### Contexte ERNIE-4.5-VL-28B-A3B-Thinking prolonge la famille ERNIE 4.5 ouverte en juin 2025. Il améliore le raisonnement visuel de la variante ERNIE-4.5-VL-28B-A3B par une longue phase de mi-entraînement et un apprentissage par renforcement multimodal. Baidu le compare à des modèles fermés de premier plan (GPT-5 et Gemini 2.5 Pro d'après la couverture presse). C'est aussi l'un des premiers modèles ouverts de cette taille à combiner raisonnement long, ancrage visuel et recours à des outils dans un même modèle, ce qui le rapproche des besoins d'agents documentaires : lecture de graphiques, de plans ou de formulaires, puis action sur le résultat. ### Ce que le modèle apporte - Raisonnement visuel multi-étapes : analyse de graphiques, raisonnement causal et STEM à partir de photos d'énoncés, grâce à un apprentissage par renforcement sur tâches vérifiables (GSPO et IcePop pour stabiliser l'entraînement des MoE, avec échantillonnage dynamique par difficulté). - « Penser avec les images » : le modèle peut zoomer sur une image et rechercher des images via des outils pour lever une ambiguïté. - Ancrage visuel (grounding) renforcé et meilleur suivi d'instructions pour des scénarios industriels. - Appel d'outils et recherche d'images pour identifier les connaissances de longue traîne. - Compréhension vidéo : repérage d'événements et de changements sur différents segments temporels. La fiche insiste sur la conscience temporelle et la localisation d'événements dans les vidéos. ### Architecture et caractéristiques - Architecture : MoE vision-langage de 28 milliards de paramètres au total, 3 milliards actifs, issu d'ERNIE-4.5-VL-28B-A3B. - Modalités : texte, image, vidéo. Langues : anglais et chinois. Contexte et coupure des connaissances : non communiqués dans la fiche consultée. - Licence : Apache 2.0 (usage commercial libre). - Poids : baidu/ERNIE-4.5-VL-28B-A3B-Thinking sur Hugging Face ; la fiche demande transformers 4.57.6 au plus. ### Coût et accès Aucun tarif d'API n'a été consulté. VentureBeat indique qu'un seul GPU de 80 Go suffit, un matériel qu'il chiffre entre 10 000 et 30 000 dollars selon le modèle. | Poste | Information | | --- | --- | | API officielle Baidu | Tarif non consulté | | Auto-hébergement | 1 GPU de 80 Go (VentureBeat, source secondaire) | | Licence | Apache 2.0 | ### Benchmarks | Indicateur | Information | | --- | --- | | Comparaison publiée | Image benchmark.jpg dans la fiche Hugging Face, sans valeurs en texte | | Modèles de comparaison cités par la presse | GPT-5, Gemini 2.5 Pro | | Validation indépendante | Aucune à la date de la couverture consultée | Source : fiche Hugging Face et article VentureBeat. Aucun tableau chiffré exploitable en texte : les scores sont dans une image de la fiche et aucune mesure tierce n'a été trouvée. ### Face aux modèles fermés Aucun score chiffré ne peut être cité en texte : Baidu affirme dans sa fiche que le modèle, avec 3 milliards de paramètres actifs, égale de près les modèles phares du secteur sur plusieurs benchmarks, et VentureBeat rapporte l'affirmation selon laquelle il dépasse des modèles de Google et d'OpenAI sur des tâches de vision (documents, graphiques, raisonnement visuel), en notant que la vérification indépendante manque. Ces jugements sont des annonces de l'éditeur, à confirmer par des classements tiers. L'écart de prix n'est pas chiffrable. Ce qui est établi est pratique : un modèle sous Apache 2.0 qui tient sur un GPU de 80 Go permet de traiter des documents et des graphiques sans envoyer de données à un fournisseur externe. ### À retenir ERNIE-4.5-VL-28B-A3B-Thinking apporte un raisonnement visuel avec zoom sur les images et appel d'outils dans un modèle léger sous Apache 2.0. Les affirmations de parité avec les modèles fermés restent à vérifier par des mesures indépendantes.

Liens

Tags : LLM, Open Source, Baidu, ERNIE, Apache 2.0, MoE, Vision-langage