Voxtral TTS

2026-03-23 · Éditeur : Mistral AI · Domaine : Intelligence Artificielle

Mistral AI lance Voxtral TTS, son premier modèle de synthèse vocale : 4 milliards de paramètres, 9 langues, adaptation de voix en quelques secondes et poids ouverts sous licence CC BY-NC 4.0.

Ce qui change

  • Premier modèle de synthèse vocale de Mistral, compact et à faible latence.
  • Voix expressives dans 9 langues avec dialectes, adaptation de nouvelles voix (échantillon de 5 à 25 secondes).
  • Adaptation de voix translingue sans entraînement préalable.
  • Jusqu'à 2 minutes d'audio générées nativement.

Mistral AI lance Voxtral TTS, son premier modèle de synthèse vocale : 4 milliards de paramètres, 9 langues, adaptation de voix en quelques secondes et poids ouverts sous licence CC BY-NC 4.0. ### Ce qui change - Premier modèle de synthèse vocale de Mistral, compact et à faible latence. - Voix expressives dans 9 langues avec dialectes, adaptation de nouvelles voix (échantillon de 5 à 25 secondes). - Adaptation de voix translingue sans entraînement préalable. - Jusqu'à 2 minutes d'audio générées nativement. ### Caractéristiques - Taille : environ 4B (décodeur de 3,4B, transformeur acoustique de 390M, codec de 300M). - Langues : anglais, français, allemand, espagnol, néerlandais, portugais, italien, hindi, arabe. - Licence : CC BY-NC 4.0 (poids sur Hugging Face, usage non commercial ; l'API couvre l'usage commercial). - Endpoint : /v1/audio/speech. Disponibilité : API, Mistral Studio, Le Chat, Hugging Face. - Latence annoncée : 70 ms pour un échantillon typique de 10 secondes. ### Tarifs | Élément | Tarif | |---|---| | API | 0,016 USD pour 1 000 caractères | ### Benchmarks | Mesure | Résultat | |---|---| | Préférence humaine sur la personnalisation de voix face à ElevenLabs Flash v2.5 | 68,4 % | Scores publiés par l'éditeur (évaluation humaine par locuteurs natifs). ### À retenir Une brique vocale ouverte et peu coûteuse complète la transcription Voxtral pour construire des agents vocaux maîtrisés de bout en bout.

Liens

Tags : LLM, Mistral, Voxtral, Audio, Synthèse vocale, Open Source