gpt-realtime-mini, gpt-audio-mini et gpt-image-1-mini
2025-10-06 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
Lors du DevDay, OpenAI ouvre dans l'API trois modèles plus économiques : gpt-realtime-mini et gpt-audio-mini pour la parole à parole, et gpt-image-1-mini pour la génération d'images.
Ce qui change
- gpt-realtime-mini : version allégée de gpt-realtime, environ 70 % moins chère avec une qualité comparable, via WebRTC, WebSocket et SIP.
- gpt-audio-mini : version économique de gpt-audio pour l'audio en entrée et en sortie dans Chat Completions.
- gpt-image-1-mini : environ 80 % moins cher que gpt-image-1 pour un rendu proche, pour la génération et la retouche d'images.
- Le même jour : GPT-5 pro et Sora 2 avec Sora 2 Pro deviennent disponibles dans l'API (voir les fiches GPT-5 et Sora 2).
- De nouveaux instantanés de décembre 2025 (2025-12-15) améliorent la fiabilité et la fidélité vocale des modèles mini audio.
Lors du DevDay, OpenAI ouvre dans l'API trois modèles plus économiques : gpt-realtime-mini et gpt-audio-mini pour la parole à parole, et gpt-image-1-mini pour la génération d'images. ### Ce qui change - gpt-realtime-mini : version allégée de gpt-realtime, environ 70 % moins chère avec une qualité comparable, via WebRTC, WebSocket et SIP. - gpt-audio-mini : version économique de gpt-audio pour l'audio en entrée et en sortie dans Chat Completions. - gpt-image-1-mini : environ 80 % moins cher que gpt-image-1 pour un rendu proche, pour la génération et la retouche d'images. - Le même jour : GPT-5 pro et Sora 2 avec Sora 2 Pro deviennent disponibles dans l'API (voir les fiches GPT-5 et Sora 2). - De nouveaux instantanés de décembre 2025 (2025-12-15) améliorent la fiabilité et la fidélité vocale des modèles mini audio. ### Caractéristiques - gpt-realtime-mini : contexte 32 000 tokens, sortie 4 096 tokens, entrées texte, image et audio, sorties texte et audio, coupure 1er octobre 2023. - gpt-audio-mini : contexte 128 000 tokens, sortie 16 384 tokens, coupure 1er octobre 2023. - gpt-image-1-mini : entrées texte et image, sortie image. ### Tarifs Prix par million de tokens (USD), d'après la documentation actuelle. | Modèle | Entrée texte | Sortie texte | Autre | | --- | --- | --- | --- | | gpt-realtime-mini | 0,60 (cache 0,06) | 2,40 | tarifs audio non repris | | gpt-audio-mini | 0,60 | 2,40 | tarifs audio non repris | | gpt-image-1-mini | 2 | non applicable | image : 2,50 en entrée, 8 en sortie | Par image 1024x1024 : environ 0,005 (basse), 0,011 (moyenne), 0,036 (haute) dollar. ### Benchmarks Aucun score publié par l'éditeur pour ces modèles dans les sources consultées. ### À retenir Ces variantes mini abaissent le coût des agents vocaux et des pipelines d'images en volume, au prix d'une qualité inférieure aux modèles complets.
Liens
Tags : Audio, Image, OpenAI, Temps réel, DevDay, API