gpt-realtime
2025-08-28 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
OpenAI rend l'API Realtime généralement disponible et lance gpt-realtime, son modèle de parole à parole le plus avancé, avec un meilleur suivi d'instructions, des appels d'outils plus précis et des voix plus naturelles.
Ce qui change
- API Realtime en disponibilité générale, avec serveurs MCP distants, entrée image et appels téléphoniques par SIP.
- Modèle unique qui traite et génère l'audio directement, sans chaîner transcription, LLM et synthèse vocale.
- Deux nouvelles voix, Cedar et Marin, exclusives à l'API Realtime, et huit voix existantes améliorées.
- Sait suivre des consignes fines (« parle vite et sur un ton professionnel »), changer de langue en cours de phrase et saisir des séquences alphanumériques.
- Appels de fonctions asynchrones : la conversation continue pendant qu'un appel long s'exécute.
OpenAI rend l'API Realtime généralement disponible et lance gpt-realtime, son modèle de parole à parole le plus avancé, avec un meilleur suivi d'instructions, des appels d'outils plus précis et des voix plus naturelles. ### Ce qui change - API Realtime en disponibilité générale, avec serveurs MCP distants, entrée image et appels téléphoniques par SIP. - Modèle unique qui traite et génère l'audio directement, sans chaîner transcription, LLM et synthèse vocale. - Deux nouvelles voix, Cedar et Marin, exclusives à l'API Realtime, et huit voix existantes améliorées. - Sait suivre des consignes fines (« parle vite et sur un ton professionnel »), changer de langue en cours de phrase et saisir des séquences alphanumériques. - Appels de fonctions asynchrones : la conversation continue pendant qu'un appel long s'exécute. ### Caractéristiques - Contexte 32 000 tokens, sortie maximale 4 096 tokens, entrées texte, audio et image, sorties texte et audio. - Date de coupure : 1er octobre 2023. - Identifiant API : gpt-realtime (snapshot gpt-realtime-2025-08-28), via WebRTC, WebSocket et SIP. ### Tarifs Prix par million de tokens (USD), en baisse de 20 % par rapport à gpt-4o-realtime-preview. | | Entrée | Entrée en cache | Sortie | | --- | --- | --- | --- | | Audio | 32 | 0,40 | 64 | | Texte (documentation) | 4 | 0,40 | 16 | ### Benchmarks Scores publiés par l'éditeur, contre le modèle de décembre 2024. | Benchmark | gpt-realtime | Modèle de décembre 2024 | | --- | --- | --- | | Big Bench Audio (raisonnement) | 82,8 % | 65,6 % | | MultiChallenge audio (suivi d'instructions) | 30,5 % | 20,6 % | | ComplexFuncBench audio (appels de fonctions) | 66,5 % | 49,7 % | ### À retenir gpt-realtime rend les agents vocaux exploitables en production : centres d'appels, assistants et éducation. Le raccordement MCP et SIP simplifie l'intégration aux outils et à la téléphonie existants.
Liens
Tags : Audio, LLM, OpenAI, Temps réel, Voix, MCP