T5Gemma 2

2025-12-18 · Éditeur : Google · Domaine : Intelligence Artificielle

Google publie T5Gemma 2, la nouvelle génération de ses modèles encodeur-décodeur basée sur Gemma 3 : les premiers modèles encodeur-décodeur multimodaux et à long contexte, en trois tailles compactes.

Ce qui change

  • Multimodalité : compréhension d'images en plus du texte, via un encodeur de vision efficace.
  • Contexte étendu jusqu'à 128 000 tokens grâce à l'attention locale et globale alternée de Gemma 3.
  • Plus de 140 langues prises en charge d'emblée.
  • Changements d'architecture : embeddings liés entre encodeur et décodeur, attention fusionnée du décodeur.

Google publie T5Gemma 2, la nouvelle génération de ses modèles encodeur-décodeur basée sur Gemma 3 : les premiers modèles encodeur-décodeur multimodaux et à long contexte, en trois tailles compactes. ### Ce qui change - Multimodalité : compréhension d'images en plus du texte, via un encodeur de vision efficace. - Contexte étendu jusqu'à 128 000 tokens grâce à l'attention locale et globale alternée de Gemma 3. - Plus de 140 langues prises en charge d'emblée. - Changements d'architecture : embeddings liés entre encodeur et décodeur, attention fusionnée du décodeur. ### Caractéristiques - Tailles pré-entraînées : 270M-270M (environ 370 M au total, hors encodeur de vision), 1B-1B (environ 1,7 B), 4B-4B (environ 7 B). - Checkpoints disponibles sur Kaggle, Hugging Face, Google Colab et Vertex AI. ### Tarifs Modèles ouverts, sans tarif d'usage propre. ### Benchmarks Le billet présente des résultats face aux modèles de référence sous forme de graphiques, sans chiffres dans le texte. ### À retenir Étend la famille encodeur-décodeur aux usages multimodaux et à long contexte, avec de petits modèles adaptés aux appareils.

Liens

Tags : Open Source, LLM, Google, Gemma, Encodeur-décodeur