OpenAI o3 et o4-mini
2025-04-16 · Éditeur : OpenAI · Domaine : Intelligence Artificielle
OpenAI lance o3, son modèle de raisonnement le plus puissant, et o4-mini, une version rapide et économique. Pour la première fois, ces modèles peuvent combiner tous les outils de ChatGPT et raisonner sur les images.
Ce qui change
- o3 fixe de nouveaux records annoncés sur Codeforces, SWE-bench (sans scaffold spécifique) et MMMU, avec 20 % d'erreurs majeures en moins qu'o1 selon des experts externes.
- o4-mini est présenté comme le meilleur modèle évalué sur AIME 2024 et 2025, avec des limites d'usage nettement plus hautes qu'o3.
- Les deux modèles décident quand appeler recherche web, Python, analyse de fichiers et génération d'image, et « pensent avec des images » (zoom, rotation).
- Lancement de Codex CLI, agent de code open source en terminal.
- o3-pro est annoncé pour quelques semaines plus tard (paru le 10 juin 2025).
OpenAI lance o3, son modèle de raisonnement le plus puissant, et o4-mini, une version rapide et économique. Pour la première fois, ces modèles peuvent combiner tous les outils de ChatGPT et raisonner sur les images. ### Ce qui change - o3 fixe de nouveaux records annoncés sur Codeforces, SWE-bench (sans scaffold spécifique) et MMMU, avec 20 % d'erreurs majeures en moins qu'o1 selon des experts externes. - o4-mini est présenté comme le meilleur modèle évalué sur AIME 2024 et 2025, avec des limites d'usage nettement plus hautes qu'o3. - Les deux modèles décident quand appeler recherche web, Python, analyse de fichiers et génération d'image, et « pensent avec des images » (zoom, rotation). - Lancement de Codex CLI, agent de code open source en terminal. - o3-pro est annoncé pour quelques semaines plus tard (paru le 10 juin 2025). ### Caractéristiques - Contexte 200 000 tokens, sortie maximale 100 000 tokens, entrée texte et image, sortie texte. - Date de coupure : 1er juin 2024. - Identifiants API : o3 (o3-2025-04-16) et o4-mini (o4-mini-2025-04-16), via Chat Completions et Responses ; ChatGPT Plus, Pro et Team dès le jour même, Enterprise et Edu une semaine après. ### Tarifs Tarifs de lancement par million de tokens (USD), page tarifs d'OpenAI du 1er mai 2025. | Modèle | Entrée | Entrée en cache | Sortie | | --- | --- | --- | --- | | o3 | 10,00 | 2,50 | 40,00 | | o4-mini | 1,10 | 0,275 | 4,40 | Le prix d'o3 a été ramené à 2 et 8 dollars le 10 juin 2025. ### Benchmarks Scores publiés par l'éditeur dans le texte de l'annonce. | Mesure | o3 | o4-mini | | --- | --- | --- | | AIME 2025 avec Python (pass@1) | 98,4 % | 99,5 % | | AIME 2025 avec Python (consensus@8) | 100 % | 100 % | Les résultats sur GPQA, SWE-bench ou MMMU sont des graphiques. Repris de l'annonce GPT-5 d'août 2025 (effort élevé) : SWE-bench Verified 69,1 % (o3) et 68,1 % (o4-mini), GPQA Diamond 83,3 % et 81,4 %. ### À retenir o3 et o4-mini inaugurent les modèles de raisonnement agentiques. o4-mini offre le meilleur rapport coût, performance pour les usages à volume élevé.
Liens
Tags : LLM, OpenAI, o-series, Raisonnement, Multimodal, Agent