o3 atteint 75,7 % sur ARC-AGI

2024-12-20 · Éditeur : OpenAI · Domaine : Intelligence Artificielle

OpenAI présente o3, son nouveau modèle de raisonnement, qui obtient 75,7 % sur le test ARC-AGI dans la limite de calcul du concours, et 87,5 % avec 172 fois plus de calcul. GPT-4o plafonnait à 5 %.

Ce qui change

  • 75,7 % sur l'ensemble semi-privé d'ARC-AGI dans la limite de 10 000 USD de calcul, 87,5 % en configuration de calcul maximal.
  • Saut brutal : ARC-AGI-1 était passé de 0 % (GPT-3, 2020) à seulement 5 % (GPT-4o, 2024).
  • Autres résultats annoncés : 96,7 % à l'AIME 2024 et 25,2 % sur FrontierMath, où aucun modèle ne dépassait 2 %.
  • Le gain vient du calcul au moment de la réponse : plus le modèle raisonne longtemps, plus il réussit, mais plus il coûte.
  • François Chollet, créateur du test, salue une percée tout en estimant qu'o3 n'est pas une IA générale.

Le 20 décembre 2024, dernier jour de sa série d'annonces de fin d'année, OpenAI présente o3 et o3-mini, successeurs du modèle de raisonnement o1 (le nom « o2 » a été écarté en raison de la marque de l'opérateur britannique O2). Le résultat le plus commenté vient d'ARC-AGI, un test conçu par François Chollet pour mesurer la capacité d'adaptation à des problèmes inédits. ### Ce qui s'est passé - La fondation ARC Prize a évalué o3 sur ses ensembles de test et publié les résultats le jour même. - En configuration « haute efficacité », conforme à la limite de calcul du classement public, o3 obtient 75,7 % sur l'ensemble semi-privé. - En configuration « basse efficacité », avec 172 fois plus de calcul, il atteint 87,5 %. - OpenAI annonce aussi 96,7 % à l'examen de mathématiques AIME 2024, 25,2 % sur FrontierMath et 71,7 % sur SWE-bench Verified, soit 22,8 points de plus qu'o1. ### Chiffres clés | Mesure (ARC-AGI-1) | Valeur | |---|---| | GPT-3 (2020) | 0 % | | GPT-4o (2024) | 5 % | | o3, ensemble semi-privé, haute efficacité | 75,7 % | | o3, ensemble semi-privé, calcul x172 | 87,5 % | | o3, ensemble public, haute efficacité / calcul x172 | 82,8 % / 91,5 % | ### Pourquoi c'est un tournant ARC-AGI résistait depuis 2019 aux grands modèles de langage, qui échouaient sur des énigmes visuelles simples pour un humain. o3 montre que l'augmentation du calcul au moment de l'inférence, et non seulement la taille du modèle, peut débloquer des capacités de raisonnement nouvelles. François Chollet parle d'« a genuine breakthrough, marking a qualitative shift in AI capabilities » (une véritable percée, qui marque un changement qualitatif des capacités de l'IA). ### Réserves Chollet précise aussitôt : « I don't think o3 is AGI yet. o3 still fails on some very easy tasks » (je ne pense pas qu'o3 soit déjà une IA générale ; o3 échoue encore sur des tâches très faciles). Le coût par tâche en configuration maximale se chiffre en milliers de dollars. Les résultats portent sur une préversion : le modèle o3 mis à disposition le 16 avril 2025 est une version différente, optimisée pour l'usage. ARC-AGI-2, publié en 2025, remet les compteurs à un niveau bas. ### À retenir o3 marque l'essor des modèles qui « réfléchissent » plus longtemps pour mieux répondre : la performance devient une question de budget de calcul au moment de l'usage, avec un arbitrage coût-qualité à piloter.

Liens

Tags : IA, Raisonnement, Benchmarks, OpenAI, ARC-AGI