Voxtral Transcribe 2
2026-02-04 · Éditeur : Mistral AI · Domaine : Intelligence Artificielle
Mistral AI lance Voxtral Transcribe 2, deux modèles de transcription vocale : Voxtral Mini Transcribe V2 en mode batch et Voxtral Realtime en temps réel, ce dernier sous licence Apache 2.0.
Ce qui change
- Deux modèles : Voxtral Mini Transcribe V2 (transcription par lots) et Voxtral Realtime (applications en direct, latence inférieure à 200 ms possible).
- Diarisation des locuteurs avec horodatage précis, horodatage au mot et biais de contexte (jusqu'à 100 mots ou expressions).
- Robustesse au bruit et audio jusqu'à 3 heures par requête.
- 13 langues prises en charge.
Mistral AI lance Voxtral Transcribe 2, deux modèles de transcription vocale : Voxtral Mini Transcribe V2 en mode batch et Voxtral Realtime en temps réel, ce dernier sous licence Apache 2.0. ### Ce qui change - Deux modèles : Voxtral Mini Transcribe V2 (transcription par lots) et Voxtral Realtime (applications en direct, latence inférieure à 200 ms possible). - Diarisation des locuteurs avec horodatage précis, horodatage au mot et biais de contexte (jusqu'à 100 mots ou expressions). - Robustesse au bruit et audio jusqu'à 3 heures par requête. - 13 langues prises en charge. ### Caractéristiques - Langues : anglais, chinois, hindi, espagnol, arabe, français, portugais, russe, allemand, japonais, coréen, italien, néerlandais. - Licence : Apache 2.0 pour Voxtral Realtime (poids sur Hugging Face) ; Voxtral Mini Transcribe V2 disponible via API sous licence Premier (propriétaire, selon la documentation Mistral). - Disponibilité : API Mistral, Mistral Studio (audio playground), Le Chat. - Contexte, sortie maximale et date de coupure : sans objet ou non communiqués. ### Tarifs | Modèle | Tarif | |---|---| | Voxtral Mini Transcribe V2 | 0,003 USD par minute | | Voxtral Realtime | 0,006 USD par minute | ### Benchmarks | Mesure | Résultat | |---|---| | Taux d'erreur de mots sur FLEURS (Mini Transcribe V2) | environ 4 % | Scores publiés par l'éditeur. Mistral affirme aussi surpasser GPT-4o mini Transcribe, Gemini 2.5 Flash et Assembly Universal en précision, sans chiffres détaillés retenus ici. ### À retenir Un modèle de transcription ouvert (Realtime) déployable en périphérie permet de garder les données audio en interne, tandis que la version batch vise les usages à fort volume à faible coût.
Liens
Tags : LLM, Mistral, Voxtral, Audio, Transcription, Open Source