Médaille d'or aux Olympiades de mathématiques pour OpenAI et Google DeepMind

2025-07-19 · Éditeur : Google DeepMind · Domaine : Intelligence Artificielle

Deux modèles de langage généralistes, l'un d'OpenAI, l'autre de Google DeepMind, obtiennent 35 points sur 42 aux Olympiades internationales de mathématiques 2025, soit le niveau de la médaille d'or, en rédigeant leurs preuves en langage naturel.

Ce qui change

  • Les deux systèmes résolvent 5 problèmes sur 6 et obtiennent 35 points sur 42, le seuil de l'or.
  • Les conditions sont celles des candidats : deux épreuves de 4 h 30, sans outil ni internet, preuves rédigées en langage naturel.
  • Le résultat de Google DeepMind (Gemini Deep Think) est certifié par les coordinateurs de l'OIM ; celui d'OpenAI est noté par trois anciens médaillés.
  • En 2024, AlphaProof avait obtenu l'argent, mais avec une traduction formelle des énoncés et plusieurs jours de calcul.
  • Le raisonnement mathématique de haut niveau n'est plus hors de portée des modèles généralistes.

Les Olympiades internationales de mathématiques (OIM) 2025 se tiennent en juillet en Australie. Le 19 juillet, OpenAI annonce qu'un modèle de raisonnement expérimental a atteint le niveau de la médaille d'or. Le 21 juillet, Google DeepMind annonce à son tour la médaille d'or pour une version avancée de Gemini Deep Think, résultat certifié par les organisateurs. ### Ce qui s'est passé - **OpenAI** : un modèle expérimental généraliste, non spécialisé en mathématiques, résout 5 des 6 problèmes (35 points sur 42) dans les conditions de l'épreuve : deux sessions de 4 h 30, sans outil ni accès à internet, preuves en langage naturel. Chaque preuve est notée par trois anciens médaillés de l'OIM, à l'unanimité. - **Google DeepMind** : Gemini Deep Think obtient lui aussi 35 points sur 42. Le président de l'OIM, Gregor Dolinar, confirme : « Google DeepMind has reached the much-desired milestone, earning 35 out of a possible 42 points — a gold medal score » (Google DeepMind a atteint l'objectif tant attendu, avec 35 points sur 42 possibles, un score de médaille d'or). - **Progrès sur un an** : en 2024, AlphaProof et AlphaGeometry avaient obtenu l'équivalent de l'argent, mais les énoncés devaient être traduits en langage formel par des humains et le calcul avait duré deux à trois jours. ### Pourquoi c'est un tournant Les deux résultats sont obtenus par des modèles de langage généralistes, avec des techniques de raisonnement parallèle et d'apprentissage par renforcement, et non par des systèmes de preuve formelle dédiés. C'est un signal fort sur la capacité des modèles à enchaîner de longs raisonnements rigoureux, au-delà des tests de connaissances. ### Réserves Le résultat d'OpenAI n'a pas été certifié par l'OIM. Les organisateurs avaient demandé aux laboratoires d'attendre une semaine après la cérémonie de clôture pour laisser la lumière aux candidats ; OpenAI a publié son annonce dès la clôture, ce qui lui a été reproché, tandis que Google DeepMind a attendu la certification. Les deux modèles n'étaient pas publics au moment de l'annonce, et cinq problèmes résolus sur six ne préjugent pas d'une fiabilité équivalente sur des travaux de recherche. ### À retenir Juillet 2025 marque l'arrivée des modèles généralistes au niveau des meilleurs jeunes mathématiciens du monde sur une épreuve de raisonnement pur.

Liens

Tags : IA, Science, Raisonnement, Mathématiques, Google DeepMind, OpenAI