GPT-4o (Omni)
2024-05-13 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
OpenAI présente GPT-4o (« o » pour « omni »), un modèle unique entraîné sur le texte, l'image et l'audio, qui répond à la voix en 320 ms en moyenne, égale GPT-4 Turbo pour 2 fois moins cher et devient gratuit dans ChatGPT.
Ce qui change
- Un seul modèle entraîné de bout en bout sur texte, image et audio, à la place de la chaîne transcription, modèle texte puis synthèse vocale.
- Réponse vocale en 232 ms au mieux et 320 ms en moyenne, contre 2,8 s (GPT-3.5) et 5,4 s (GPT-4) pour l'ancien mode vocal.
- Niveau de GPT-4 Turbo en anglais et en code (88,7 % au MMLU, 90,2 % à HumanEval), en progrès net sur les autres langues, la vision et l'audio.
- Dans l'API : 2 fois plus rapide, 2 fois moins cher (5 USD en entrée et 15 USD en sortie par million de tokens) et limites de débit 5 fois plus élevées que GPT-4 Turbo.
- Accessible aux utilisateurs gratuits de ChatGPT, avec des limites de messages jusqu'à 5 fois plus élevées pour les abonnés Plus.
OpenAI présente GPT-4o (« o » pour « omni »), un modèle unique entraîné de bout en bout sur le texte, l'image et l'audio, qui répond à la voix avec une latence proche de celle d'une conversation humaine et devient accessible gratuitement dans ChatGPT. ### Ce qui change - Un seul réseau traite toutes les modalités : fini l'enchaînement transcription, modèle texte puis synthèse vocale, qui perdait le ton, les voix multiples et les bruits de fond. - Réponse vocale en 232 ms au mieux, 320 ms en moyenne, contre 2,8 s (GPT-3.5) et 5,4 s (GPT-4) pour l'ancien mode vocal. - Niveau de GPT-4 Turbo en anglais et en code, nettement meilleur dans les autres langues, en vision et en audio. - Dans l'API : 2 fois plus rapide, 2 fois moins cher et des limites de débit 5 fois plus élevées que GPT-4 Turbo. - Un modèle de niveau GPT-4 ouvert aux utilisateurs gratuits de ChatGPT. ### Caractéristiques - Au lancement : entrée texte et image, sortie texte, dans ChatGPT et l'API. Le nouveau mode vocal arrive en alpha pour ChatGPT Plus dans les semaines suivantes ; l'audio et la vidéo dans l'API d'abord pour quelques partenaires. - Contexte de 128 000 tokens, coupure des connaissances à octobre 2023 (fiche modèle). - Nouveau tokenizer : 1,1 fois moins de tokens en français, jusqu'à 4,4 fois moins en gujarati. - Risque évalué « Medium » (moyen) au plus selon le Preparedness Framework, sur la persuasion ; plus de 70 experts externes en red teaming. ### Tarifs au lancement | Modèle (USD par million de tokens) | Entrée | Sortie | | --- | --- | --- | | gpt-4o-2024-05-13 | 5 | 15 | ### Benchmarks publiés par l'éditeur Scores publiés par l'éditeur (suite simple-evals, 0-shot). | Benchmark | GPT-4o | GPT-4 Turbo (2024-04-09) | | --- | --- | --- | | MMLU | 88,7 % | 86,5 % | | GPQA | 53,6 % | 49,1 % | | MATH | 76,6 % | 72,2 % | | HumanEval | 90,2 % | 87,6 % | | MGSM | 90,5 % | 88,6 % | | DROP (F1) | 83,4 | 85,4 | ### Pourquoi c'est un tournant GPT-4o fait de la voix une interface crédible : perception du ton, voix expressive (rire, chant), traduction en temps réel. Il démocratise aussi le haut de gamme en le rendant gratuit dans ChatGPT et deux fois moins cher dans l'API. ### À retenir Premier modèle « omni » d'OpenAI, il fixe le standard de la multimodalité native. Les capacités audio ont été ouvertes progressivement après l'annonce.
Liens
Tags : LLM, OpenAI, Multimodal, GPT-4, GPT-4o, Voix, Temps réel