Gemma 3 QAT

2025-04-18 · Éditeur : Google · Domaine : Intelligence Artificielle

Google publie des versions de Gemma 3 entraînées avec quantification (QAT), qui réduisent fortement la mémoire vidéo nécessaire : le modèle 27B passe de 54 Go à 14,1 Go en int4 et tient sur une carte grand public.

Ce qui change

  • Entraînement conscient de la quantification (QAT) appliqué à Gemma 3 sur environ 5 000 pas, pour limiter la perte de qualité en basse précision.
  • Gemma 3 27B tourne en local sur un GPU grand public comme la NVIDIA RTX 3090.
  • Plusieurs variantes quantifiées par taille, prêtes pour les moteurs d'inférence courants.

Google publie des versions de Gemma 3 entraînées avec quantification (QAT), qui réduisent fortement la mémoire vidéo nécessaire : le modèle 27B passe de 54 Go à 14,1 Go en int4 et tient sur une carte grand public. ### Ce qui change - Entraînement conscient de la quantification (QAT) appliqué à Gemma 3 sur environ 5 000 pas, pour limiter la perte de qualité en basse précision. - Gemma 3 27B tourne en local sur un GPU grand public comme la NVIDIA RTX 3090. - Plusieurs variantes quantifiées par taille, prêtes pour les moteurs d'inférence courants. ### Caractéristiques - Mémoire pour charger les poids : 27B de 54 Go (BF16) à 14,1 Go (int4) ; 12B de 24 Go à 6,6 Go. - 4B de 8 Go à 2,6 Go ; 1B de 2 Go à 0,5 Go. - Contexte et modalités identiques à Gemma 3 (128 000 tokens, vision pour 4B et plus). - Disponibilité : poids int4 et Q4_0 sur Hugging Face et Kaggle ; prise en charge par Ollama, MLX et llama.cpp (format GGUF). ### Tarifs Modèles à poids ouverts, sans tarif d'usage. ### Benchmarks Le billet compare la qualité (Elo Chatbot Arena) et les besoins en GPU sans reprendre de score par variante quantifiée ; la perte de qualité est décrite comme minimale. ### À retenir Rend un modèle multimodal de 27 milliards de paramètres exploitable sur un poste de travail ou un serveur modeste, un point clé pour les usages locaux.

Liens

Tags : Open Source, LLM, Google, Gemma, Quantification