Gemini 2.5 Flash et Pro TTS, Gemini 2.5 Flash Native Audio
2025-05-20 · Éditeur : Google · Domaine : Intelligence Artificielle
À Google I/O, Google ouvre en préversion la synthèse vocale de Gemini 2.5 Flash et 2.5 Pro (deux voix, plus de 24 langues) et une voix conversationnelle native pour l'API Live, améliorées en septembre et en décembre.
Ce qui change
- Synthèse vocale (TTS) expressive avec deux locuteurs, capable de chuchotements, avec passage fluide d'une langue à l'autre.
- API Live avec sortie audio native : dialogue plus naturel, réglage du ton, de l'accent et du style, appel d'outils.
- Fonctions expérimentales : dialogue affectif (détection de l'émotion), audio proactif (ignorer les conversations de fond) et réflexion dans l'API Live.
- Nouveaux modèles audio natifs en septembre 2025 (gemini-2.5-flash-native-audio-preview-09-2025) puis en décembre (...-12-2025).
- 10 décembre 2025 : TTS améliorés (Flash TTS pour la latence, Pro TTS pour la qualité), expressivité et rythme précis.
À Google I/O, Google ouvre en préversion la synthèse vocale de Gemini 2.5 Flash et 2.5 Pro (deux voix, plus de 24 langues) et une voix conversationnelle native pour l'API Live, améliorées en septembre et en décembre. ### Ce qui change - Synthèse vocale (TTS) expressive avec deux locuteurs, capable de chuchotements, avec passage fluide d'une langue à l'autre. - API Live avec sortie audio native : dialogue plus naturel, réglage du ton, de l'accent et du style, appel d'outils. - Fonctions expérimentales : dialogue affectif (détection de l'émotion), audio proactif (ignorer les conversations de fond) et réflexion dans l'API Live. - Nouveaux modèles audio natifs en septembre 2025 (`gemini-2.5-flash-native-audio-preview-09-2025`) puis en décembre (`...-12-2025`). - 10 décembre 2025 : TTS améliorés (Flash TTS pour la latence, Pro TTS pour la qualité), expressivité et rythme précis. ### Caractéristiques - Identifiants : `gemini-2.5-flash-preview-tts`, `gemini-2.5-pro-preview-tts`, `gemini-2.5-flash-native-audio-preview-12-2025`. - Disponibilité : API Gemini, Vertex AI ; TTS à plus de 24 langues. ### Tarifs Tarifs actuels de la page officielle (consultée en septembre 2026 ; ceux de la préversion de mai ne sont pas rappelés) : | Modèle | Entrée (USD / 1M tokens) | Sortie (USD / 1M tokens) | |---|---|---| | 2.5 Flash Preview TTS | 0,50 (texte) | 10 (audio) | | 2.5 Pro Preview TTS | 1,00 (texte) | 20 (audio) | | 2.5 Flash Native Audio | 0,50 (texte), 3,00 (audio/vidéo) | 2,00 (texte), 12,00 (audio) | ### Benchmarks Aucun score chiffré publié. ### À retenir Les briques vocales de Gemini deviennent utilisables pour des agents conversationnels ; elles restent en préversion à fin 2025.
Liens
Tags : Audio, LLM, Google, Gemini, Voix