gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-mini-tts
2025-03-20 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
OpenAI lance dans l'API de nouveaux modèles de reconnaissance vocale (gpt-4o-transcribe, gpt-4o-mini-transcribe) et un modèle de synthèse vocale pilotable (gpt-4o-mini-tts) pour construire des agents vocaux.
Ce qui change
- Les modèles de transcription améliorent le taux d'erreur de mots par rapport à Whisper, surtout avec accents, bruit ambiant et débit variable.
- Ils reposent sur GPT-4o et GPT-4o mini, avec pré-entraînement audio, distillation et apprentissage par renforcement.
- gpt-4o-mini-tts permet pour la première fois de dire au modèle comment parler (par exemple ton empathique de service client), avec des voix synthétiques prédéfinies.
- Intégration proposée avec le SDK Agents pour assembler un agent vocal.
OpenAI lance dans l'API de nouveaux modèles de reconnaissance vocale (gpt-4o-transcribe, gpt-4o-mini-transcribe) et un modèle de synthèse vocale pilotable (gpt-4o-mini-tts) pour construire des agents vocaux. ### Ce qui change - Les modèles de transcription améliorent le taux d'erreur de mots par rapport à Whisper, surtout avec accents, bruit ambiant et débit variable. - Ils reposent sur GPT-4o et GPT-4o mini, avec pré-entraînement audio, distillation et apprentissage par renforcement. - gpt-4o-mini-tts permet pour la première fois de dire au modèle comment parler (par exemple ton empathique de service client), avec des voix synthétiques prédéfinies. - Intégration proposée avec le SDK Agents pour assembler un agent vocal. ### Caractéristiques - gpt-4o-transcribe et gpt-4o-mini-transcribe : entrée audio, sortie texte, contexte 16 000 tokens, sortie 2 000 tokens, coupure juin 2024 (selon la documentation). - gpt-4o-mini-tts : entrée texte, sortie audio, 2 000 tokens d'entrée au maximum. - Disponibles pour tous les développeurs dans l'API audio le jour de l'annonce. ### Tarifs Tarifs par million de tokens (USD), d'après la documentation actuelle (l'annonce ne les chiffre pas). | Modèle | Entrée | Sortie | | --- | --- | --- | | gpt-4o-transcribe (audio) | 2,50 | 10 | | gpt-4o-mini-transcribe (audio) | 1,25 | 5 | | gpt-4o-mini-tts | 0,60 (texte) | 12 (audio) | ### Benchmarks Scores publiés par l'éditeur : l'annonce présente le taux d'erreur de mots sur FLEURS (plus de 100 langues) uniquement sous forme de graphiques, sans valeur numérique dans le texte. Elle indique que les modèles égalent ou dépassent les autres modèles de pointe pour la plupart des langues. ### À retenir Ces briques permettent de monter un agent vocal en chaînant transcription, LLM et synthèse, en alternative à l'API temps réel de bout en bout. Des instantanés mis à jour ont été publiés le 15 décembre 2025.
Liens
Tags : Audio, OpenAI, GPT-4o, Transcription, Synthèse vocale