Gemini 3.5 Transcribe

2026-08-26 · Éditeur : Google · Domaine : Intelligence Artificielle

Google lance Gemini 3.5 Transcribe, son modèle de reconnaissance vocale le plus précis, qui transforme l'audio en texte propre et formaté, en streaming (Live API) ou sur fichiers enregistrés.

Ce qui change

  • Gère les autocorrections et supprime les hésitations, avec mise en forme automatique.
  • Taux d'erreur de mots moyen de 4,0 % en streaming et 2,6 % hors streaming selon Artificial Analysis.
  • Vocabulaire personnalisé, détection automatique de plus de 85 langues.
  • Attribution de parole pour jusqu'à trois locuteurs avec horodatage au mot.
  • Remplace Chirp 3 : délai jusqu'à la transcription finale réduit de 70 % selon Artificial Analysis.

Google lance Gemini 3.5 Transcribe, son modèle de reconnaissance vocale le plus précis, qui transforme l'audio en texte propre et formaté, en streaming (Live API) ou sur fichiers enregistrés. ### Ce qui change - Gère les autocorrections et supprime les hésitations, avec mise en forme automatique. - Taux d'erreur de mots moyen de 4,0 % en streaming et 2,6 % hors streaming selon Artificial Analysis. - Vocabulaire personnalisé, détection automatique de plus de 85 langues. - Attribution de parole pour jusqu'à trois locuteurs avec horodatage au mot. - Remplace Chirp 3 : délai jusqu'à la transcription finale réduit de 70 % selon Artificial Analysis. ### Caractéristiques - Deux modèles : gemini-3.5-transcribe-live (streaming via la Live API) et gemini-3.5-transcribe (fichiers via l'Interactions API). - Disponibilité : API Gemini (AI Studio) et Gemini Enterprise Agent Platform. - Appel de fonctions vers d'autres modèles Gemini, disponible dans l'application macOS. ### Tarifs Page tarifs actuelle : gemini-3.5-transcribe, entrée 2,00 USD par million de tokens ou 0,003 USD par minute, sortie 12,00 USD par million de tokens ; gemini-3.5-transcribe-live : entrée 3,50 USD par million de tokens, sortie 21,00 USD. Tarif du jour de l'annonce non vérifié. ### Benchmarks | Mesure (scores publiés par l'éditeur) | Résultat | |---|---| | WER moyen, streaming (Artificial Analysis) | 4,0 % | | WER moyen, hors streaming (Artificial Analysis) | 2,6 % | | WER FLEURS, streaming | 5,50 % | | WER FLEURS, hors streaming | 5,04 % | ### À retenir Une brique de transcription pour agents vocaux, sous-titrage et analyse d'appels, avec un vocabulaire métier configurable.

Liens

Tags : Audio, Google, Gemini, Transcription, Voix