Gemini 3.1 Flash TTS

2026-04-15 · Éditeur : Google · Domaine : Intelligence Artificielle

Google lance Gemini 3.1 Flash TTS en préversion, un modèle de synthèse vocale expressif et pilotable par balises audio, avec dialogue multi-locuteurs et plus de 70 langues.

Ce qui change

  • Balises audio en langage naturel pour contrôler le style, le rythme et la livraison.
  • Dialogue multi-locuteurs natif et profils audio par personnage dans AI Studio.
  • Plus de 70 langues avec contrôle du style, du rythme et de l'accent.
  • Élo de 1 211 sur le classement TTS d'Artificial Analysis (préférences humaines à l'aveugle).
  • Sortie audio marquée SynthID.

Google lance Gemini 3.1 Flash TTS en préversion, un modèle de synthèse vocale expressif et pilotable par balises audio, avec dialogue multi-locuteurs et plus de 70 langues. ### Ce qui change - Balises audio en langage naturel pour contrôler le style, le rythme et la livraison. - Dialogue multi-locuteurs natif et profils audio par personnage dans AI Studio. - Plus de 70 langues avec contrôle du style, du rythme et de l'accent. - Élo de 1 211 sur le classement TTS d'Artificial Analysis (préférences humaines à l'aveugle). - Sortie audio marquée SynthID. ### Caractéristiques - Disponibilité : API Gemini et AI Studio (préversion), Vertex AI (préversion), Google Vids. - Identifiant : gemini-3.1-flash-tts-preview. ### Tarifs | Élément | Standard (USD / 1M tokens) | Batch | |---|---|---| | Entrée | 1,00 | 0,50 | | Sortie (audio) | 20,00 | 10,00 | Tarifs relevés sur la page tarifs actuelle. ### Benchmarks | Benchmark (scores publiés par l'éditeur) | 3.1 Flash TTS | |---|---| | Artificial Analysis TTS (Elo) | 1 211 | ### À retenir Un modèle de voix de synthèse pilotable pour applications vocales et contenus audio ; il a été suivi en septembre par la famille 3.8 TTS.

Liens

Tags : Audio, Google, Gemini, TTS, Voix