Timeline Intelligence Artificielle
Événements de l'innovation Astek dans le domaine Intelligence Artificielle.
- Mixtral 8x7B (2024-01-08) — Mistral AI lance Mixtral 8x7B, un modèle Mixture of Experts open-source qui rivalise avec GPT-3.5. Ce modèle utilise une architecture innovante permettant d'activer seulement 2 experts sur 8 pour chaque token, optimisant ainsi les performances et l'efficacité.
- Meetup GenAI #1 (2024-01-18) — Premier meetup ASTEK dédié à l'IA générative. Présentation des fondamentaux des LLMs et démonstration de cas d'usage en entreprise. Plus de 50 participants !
- Sora : OpenAI dévoile la génération vidéo réaliste (2024-02-15) — OpenAI présente Sora, un modèle qui génère à partir d'une simple description textuelle des vidéos réalistes pouvant atteindre une minute. L'accès reste d'abord réservé à des testeurs et à quelques créatifs.
- Google Gemini 1.5 Pro (2024-02-15) — Google dévoile Gemini 1.5 Pro avec une fenêtre de contexte révolutionnaire de 1 million de tokens. Cette avancée permet de traiter des documents entiers, des heures de vidéo ou des bases de code complètes en une seule requête.
- Claude 3 (Opus, Sonnet, Haiku) (2024-03-04) — Anthropic lance la famille Claude 3 avec trois modèles : Opus (le plus puissant), Sonnet (équilibré) et Haiku (rapide). Claude 3 Opus surpasse GPT-4 sur de nombreux benchmarks et introduit la vision multimodale.
- Le Parlement européen adopte l'AI Act (2024-03-13) — Réunis à Strasbourg, les députés européens adoptent le règlement sur l'intelligence artificielle par 523 voix pour, 46 contre et 49 abstentions : la première loi contraignante au monde consacrée à l'IA franchit son étape décisive.
- POC RAG Documentaire (2024-03-15) — L'équipe iLab développe un POC de RAG (Retrieval Augmented Generation) pour la recherche documentaire interne. Utilisation de LangChain, ChromaDB et Claude 3.
- Nouveau terme : agentique (2024-03-21) — Se dit d'un système où un modèle de langage ne répond pas d'un seul jet mais enchaîne des étapes : il planifie, utilise des outils, relit et corrige son travail, seul ou avec d'autres agents.
- Meta Llama 3 (2024-04-18) — Meta publie Llama 3 en versions 8B et 70B paramètres, établissant de nouveaux standards pour les modèles open-source. Les modèles sont disponibles sur Hugging Face et peuvent être fine-tunés librement.
- Nouveau terme : SLM (2024-04-23) — Un SLM (small language model, petit modèle de langage) compte au plus quelques milliards de paramètres. Il vise les usages embarqués, hors ligne ou à faible coût, là où un grand modèle serait surdimensionné.
- Nouveau terme : AI slop (2024-05-08) — Contenu généré en masse par IA, de faible qualité, publié sans relecture et imposé à des lecteurs qui ne l'ont pas demandé. Le « slop » est à l'IA ce que le spam est au courrier électronique.
- AlphaFold 3 (Google DeepMind et Isomorphic Labs) (2024-05-08) — Google DeepMind et Isomorphic Labs publient dans Nature AlphaFold 3, qui prédit la structure et les interactions de presque toutes les molécules du vivant : protéines, ADN, ARN, ligands. Un serveur gratuit l'ouvre aux chercheurs.
- GPT-4o (Omni) (2024-05-13) — OpenAI présente GPT-4o (« o » pour « omni »), un modèle unique entraîné sur le texte, l'image et l'audio, qui répond à la voix en 320 ms en moyenne, égale GPT-4 Turbo pour 2 fois moins cher et devient gratuit dans ChatGPT.
- Apple Intelligence annoncée à la WWDC (2024-06-10) — À la WWDC, Apple présente Apple Intelligence, son système d'IA générative intégré à l'iPhone, à l'iPad et au Mac. Il combine des modèles exécutés sur l'appareil, un cloud privé dédié et une intégration de ChatGPT.
- Nvidia devient l'entreprise la plus valorisée au monde (2024-06-18) — Portée par la demande en puces pour l'IA, Nvidia atteint 3 335 Md USD de capitalisation boursière et dépasse Microsoft : le fournisseur des GPU devient, pour quelques jours, l'entreprise cotée la plus valorisée au monde.
- Claude 3.5 Sonnet (2024-06-20) — Anthropic lance Claude 3.5 Sonnet, premier modèle de la famille 3.5 : il dépasse Claude 3 Opus sur la plupart des évaluations, 2 fois plus vite et 5 fois moins cher, et inaugure les « Artifacts » dans Claude.ai.
- Hackathon IA ASTEK (2024-06-28) — Premier hackathon interne dédié à l'IA. 48h pour développer des solutions innovantes utilisant les LLMs. 8 équipes, 32 participants, 3 projets primés.
- Llama 3.1 405B : un modèle ouvert au niveau des meilleurs modèles fermés (2024-07-23) — Meta publie Llama 3.1, dont la version 405B est le premier modèle à poids ouverts présenté au niveau de GPT-4o et de Claude 3.5 Sonnet. L'écart entre modèles ouverts et fermés se réduit nettement.
- Mistral Large 2 (2024-07-24) — Mistral AI lance Mistral Large 2 (123B paramètres), un modèle frontier rivalisant avec GPT-4o et Claude 3.5 Sonnet. Support de 80+ langues et fenêtre de contexte de 128k tokens.
- Entrée en vigueur de l'AI Act (2024-08-01) — Le règlement (UE) 2024/1689 sur l'intelligence artificielle entre en vigueur le 1er août 2024. Il ouvre un calendrier d'application échelonné jusqu'en 2027, des interdictions aux obligations des systèmes à haut risque.
- Nouveau terme : modèle de raisonnement (2024-09-12) — Un modèle de raisonnement est entraîné à « réfléchir » avant de répondre en produisant une chaîne de pensée. Le test-time compute (calcul à l'inférence) désigne ce calcul supplémentaire, devenu un nouveau levier de performance.
- OpenAI o1 (Strawberry) (2024-09-12) — OpenAI inaugure la série o1, des modèles entraînés par renforcement à « réfléchir » avant de répondre. o1-preview et o1-mini sortent dans ChatGPT et l'API ; o1 atteint 83 % à l'AIME 2024 contre 13 % pour GPT-4o.
- Microsoft relance la centrale nucléaire de Three Mile Island (2024-09-20) — Constellation Energy signe avec Microsoft un contrat d'achat d'électricité de 20 ans pour redémarrer le réacteur n° 1 de Three Mile Island, arrêté en 2019. L'énergie devient un enjeu direct de la course à l'IA.
- OpenAI lève 6,6 Md USD pour une valorisation de 157 Md USD (2024-10-02) — OpenAI boucle une levée de 6,6 Md USD qui la valorise 157 Md USD, l'un des plus gros tours de table jamais réalisés par une entreprise non cotée. L'argent doit financer la recherche et la puissance de calcul.
- Prix Nobel de physique et de chimie : l'IA consacrée (2024-10-09) — Le 8 octobre, le Nobel de physique récompense John Hopfield et Geoffrey Hinton pour les fondements des réseaux de neurones ; le 9, celui de chimie distingue David Baker, Demis Hassabis et John Jumper pour la conception et la prédiction des protéines.
- Claude Computer Use (2024-10-22) — Anthropic ouvre en bêta publique « computer use » : Claude voit l'écran, déplace le curseur, clique et tape au clavier. Annoncé avec un Claude 3.5 Sonnet amélioré (49 % à SWE-bench Verified) et Claude 3.5 Haiku.
- Model Context Protocol (MCP) : Anthropic publie le standard ouvert des agents (2024-11-25) — Anthropic publie le Model Context Protocol, un standard ouvert pour connecter les assistants d'IA aux outils et aux données. En un an, MCP devient le protocole de référence des agents, adopté par OpenAI, Google et Microsoft.
- Google Gemini 2.0 Flash (2024-12-11) — Google lance Gemini 2.0 Flash avec des capacités agentiques natives : génération d'images, text-to-speech, exécution de code. Disponible via l'API et dans AI Studio.
- Nouveau terme : deep research (2024-12-11) — Le deep research (recherche approfondie) désigne un agent qui mène seul, pendant plusieurs minutes, une recherche en plusieurs étapes sur le web, puis rédige un rapport structuré et sourcé.
- Nouveau terme : agents contre workflows (2024-12-19) — Anthropic distingue les workflows, où le code enchaîne les appels au modèle selon un chemin prédéfini, et les agents, où le modèle décide lui-même de ses étapes et de ses outils. La règle : la solution la plus simple d'abord.
- o3 atteint 75,7 % sur ARC-AGI (2024-12-20) — OpenAI présente o3, son nouveau modèle de raisonnement, qui obtient 75,7 % sur le test ARC-AGI dans la limite de calcul du concours, et 87,5 % avec 172 fois plus de calcul. GPT-4o plafonnait à 5 %.
- Codestral 25.01 (2025-01-13) — Mistral AI lance Codestral 25.01, une mise à jour de son modèle de code avec architecture et tokenizer plus efficaces, environ deux fois plus rapide en génération et en complétion, avec 256k tokens de contexte.
- MiniMax-Text-01 (et MiniMax-VL-01) (2025-01-15) — MiniMax publie en poids ouverts MiniMax-Text-01, un MoE de 456 milliards de paramètres qui combine attention linéaire Lightning et attention softmax, avec un contexte de 4 millions de tokens en inférence.
- Kickoff Innovation 2025 (2025-01-16) — Lancement officiel du programme Innovation 2025 d'ASTEK. Présentation de la feuille de route IA et des objectifs de l'année.
- DeepSeek R1 (2025-01-20) — DeepSeek publie R1, un modèle de raisonnement de 671 milliards de paramètres (37 milliards actifs) sous licence MIT, dont les scores annoncés rejoignent ceux d'OpenAI o1, avec six modèles distillés.
- Stargate : jusqu'à 500 Md USD d'infrastructures d'IA (2025-01-21) — À la Maison-Blanche, OpenAI, SoftBank, Oracle et MGX annoncent Stargate, une coentreprise qui prévoit d'investir jusqu'à 500 Md USD en quatre ans dans des centres de données d'IA aux États-Unis.
- Gemini 2.0 Flash Thinking Experimental (01-21) (2025-01-21) — Google publie une mise à jour du modèle de raisonnement Gemini 2.0 Flash Thinking Experimental, avec une fenêtre de contexte portée à 1 million de tokens et l'exécution de code native.
- Computer-Using Agent (CUA) (2025-01-23) — OpenAI présente Computer-Using Agent (CUA), un modèle qui associe la vision de GPT-4o et un raisonnement entraîné par renforcement pour manipuler une interface graphique. Il alimente l'agent Operator.
- Qwen2.5-VL (2025-01-26) — Alibaba Qwen publie Qwen2.5-VL en trois tailles (3B, 7B, 72B) : un modèle vision-langage à poids ouverts capable d'agir comme agent visuel, de comprendre des vidéos d'une heure et de produire des sorties structurées.
- Choc DeepSeek : Nvidia perd 17 % en une séance (2025-01-27) — Une semaine après la sortie de DeepSeek R1, les marchés doutent du besoin de dépenses massives en puces : Nvidia recule d'environ 17 % et perd près de 589 Md USD de capitalisation, un record historique pour une seule séance.
- Qwen2.5-1M (2025-01-27) — Alibaba Qwen publie Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, deux modèles à poids ouverts acceptant jusqu'à 1 million de tokens, avec un cadre d'inférence vLLM adapté et une attention parcimonieuse.
- Tülu 3 405B (2025-01-30) — Ai2 publie Tülu 3 405B, un modèle issu de Llama 3.1 405B post-entraîné avec la recette ouverte Tülu 3 (SFT, DPO, RLVR), dont Ai2 affirme qu'il rivalise avec DeepSeek V3 et GPT-4o.
- Mistral Small 3 (2025-01-30) — Mistral AI publie Mistral Small 3, un modèle de 24 milliards de paramètres optimisé pour la latence, sous licence Apache 2.0, présenté comme comparable à Llama 3.3 70B tout en étant plus de 3 fois plus rapide.
- o3-mini (2025-01-31) — OpenAI lance o3-mini, son modèle de raisonnement compact le plus économique, optimisé pour les sciences, les mathématiques et le code, disponible dans ChatGPT et l'API le jour même.
- Deep research (2025-02-02) — OpenAI lance deep research dans ChatGPT, un agent qui mène des recherches web en plusieurs étapes avec une version d'o3 optimisée pour la navigation et l'analyse de données.
- Nouveau terme : vibe coding (2025-02-02) — Le vibe coding consiste à développer en décrivant ce que l'on veut à une IA en langage naturel et à accepter le code produit sans vraiment le lire, en ne jugeant que le résultat obtenu.
- AI Act : premières interdictions applicables (2025-02-02) — Six mois après son entrée en vigueur, le règlement européen sur l'IA commence à s'appliquer : les pratiques jugées inacceptables sont interdites et les organisations doivent assurer la maîtrise de l'IA par leurs équipes.
- Gemini 2.0 Flash (disponibilité générale) (2025-02-05) — Google rend Gemini 2.0 Flash généralement disponible dans l'API Gemini, Google AI Studio et Vertex AI, avec des limites de débit plus élevées et une tarification simplifiée.
- Gemini 2.0 Flash-Lite (2025-02-05) — Google lance Gemini 2.0 Flash-Lite, son modèle le plus économique à ce stade : meilleur que 1.5 Flash à vitesse et coût équivalents, en préversion publique le 5 février puis disponible en production le 25.
- Gemini 2.0 Pro Experimental (2025-02-05) — Google publie une version expérimentale de Gemini 2.0 Pro, son meilleur modèle à l'époque pour le code et les invites complexes, avec une fenêtre de contexte de 2 millions de tokens.
- Sommet pour l'action sur l'IA à Paris (2025-02-10) — Les 10 et 11 février 2025, Paris accueille le Sommet pour l'action sur l'IA, coprésidé avec l'Inde. La veille, Emmanuel Macron annonce 109 Md€ d'investissements privés en France, surtout dans des centres de données.
- Mistral Saba (2025-02-17) — Mistral AI présente Mistral Saba, son premier modèle régional : 24 milliards de paramètres entraînés sur des données du Moyen-Orient et d'Asie du Sud, fort en arabe et en langues indiennes comme le tamoul.
- Grok 3 et Grok 3 mini (2025-02-19) — xAI présente Grok 3, son modèle phare entraîné sur le supercalculateur Colossus, et Grok 3 mini, une variante de raisonnement économique, avec les modes Think et DeepSearch.
- Moonlight (Muon à grande échelle) (2025-02-22) — Moonshot AI publie Moonlight, un MoE de 16 milliards de paramètres (3 milliards actifs) entraîné avec l'optimiseur Muon, avec code, checkpoints et rapport technique sous licence MIT.
- Claude 3.7 Sonnet (2025-02-24) — Anthropic lance Claude 3.7 Sonnet, son premier modèle de raisonnement hybride : réponses rapides ou réflexion étendue visible, avec budget réglable en API. Claude Code arrive en préversion.
- Claude Code : le début du codage par agents (2025-02-24) — En même temps que Claude 3.7 Sonnet, Anthropic ouvre en préversion de recherche Claude Code, un agent qui travaille dans le terminal : il lit le code, modifie les fichiers, lance les tests et pousse sur GitHub.
- GPT-4.5 (2025-02-27) — OpenAI publie GPT-4.5 en aperçu de recherche, son plus grand modèle de chat, fondé sur la mise à l'échelle du pré-entraînement, avec une meilleure intuition, moins d'hallucinations et un « QE » plus élevé.
- QwQ-32B (2025-03-06) — Alibaba Qwen publie QwQ-32B, un modèle de raisonnement de 32 milliards de paramètres sous Apache 2.0, entraîné par apprentissage par renforcement et présenté comme comparable à DeepSeek-R1 (671 milliards de paramètres).
- Mistral OCR (2025-03-06) — Mistral AI lance Mistral OCR, une API de reconnaissance de documents qui extrait texte, tableaux, équations et images des PDF et images, avec 94,89 % de score global sur son banc interne, à 1 dollar les 1000 pages.
- Gemini Embedding (2025-03-07) — Google lance Gemini Embedding, un modèle d'embeddings de texte dérivé de Gemini : version expérimentale le 7 mars 2025, classée première du classement MTEB multilingue, puis version stable le 14 juillet.
- computer-use-preview et gpt-4o-search-preview (2025-03-11) — OpenAI ouvre l'API Responses avec trois modèles spécialisés pour agents : computer-use-preview pour piloter un ordinateur, gpt-4o-search-preview et gpt-4o-mini-search-preview pour la recherche web.
- Gemini Robotics et Gemini Robotics-ER (2025-03-12) — Google DeepMind présente Gemini Robotics, un modèle vision-langage-action basé sur Gemini 2.0 qui commande directement des robots, et Gemini Robotics-ER, dédié au raisonnement spatial.
- Gemini 2.0 Flash (génération d'images native) (2025-03-12) — Google ouvre aux développeurs, en version expérimentale, la génération et l'édition d'images natives de Gemini 2.0 Flash, avec texte et images mélangés dans une même réponse.
- Gemma 3 (2025-03-12) — Google DeepMind publie Gemma 3, sa nouvelle famille de modèles ouverts basée sur la technologie de Gemini 2.0 : quatre tailles de 1 à 27 milliards de paramètres, multimodale et avec 128 000 tokens de contexte.
- OLMo 2 32B (2025-03-13) — Ai2 publie OLMo 2 32B, un modèle de 32 milliards de paramètres entièrement ouvert (poids, données, code) qui, selon Ai2, dépasse GPT-3.5 Turbo et GPT-4o mini sur des benchmarks académiques.
- Mistral Small 3.1 (2025-03-17) — Mistral AI dévoile Mistral Small 3.1, un modèle de 24 milliards de paramètres sous licence Apache 2.0 qui ajoute la compréhension d'images et un contexte de 128k tokens à Mistral Small 3.
- Llama Nemotron (Nano, Super, Ultra) (2025-03-18) — NVIDIA lance à GTC la famille Llama Nemotron, des modèles de raisonnement dérivés de Llama en trois tailles (8B, 49B, 253B), publiés avec leurs poids, leur jeu de post-entraînement et leur code.
- o1-pro (2025-03-19) — OpenAI met o1-pro à disposition dans l'API : une version d'o1 qui consacre plus de calcul à chaque réponse, réservée à l'API Responses et facturée à un tarif très élevé.
- gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-mini-tts (2025-03-20) — OpenAI lance dans l'API de nouveaux modèles de reconnaissance vocale (gpt-4o-transcribe, gpt-4o-mini-transcribe) et un modèle de synthèse vocale pilotable (gpt-4o-mini-tts) pour construire des agents vocaux.
- POC Agents Autonomes v2 (2025-03-20) — Nouvelle version du POC Agents avec orchestration multi-agents et intégration MCP. Démonstration de cas d'usage concrets en entreprise.
- Nemotron-H (2025-03-21) — NVIDIA publie Nemotron-H, une famille de modèles hybrides Mamba-2 et Transformer (8B, 47B et 56B) qui remplace la majorité de l'attention par des couches Mamba pour accélérer l'inférence.
- DeepSeek V3-0324 (2025-03-24) — DeepSeek publie V3-0324, mise à jour de son modèle généraliste de 685 milliards de paramètres, avec un net gain en raisonnement, en développement web et en appel d'outils, désormais sous licence MIT.
- TxGemma (2025-03-25) — Google publie TxGemma, une collection de modèles ouverts issus de Gemma 2 pour le développement thérapeutique : prédiction de propriétés de molécules et discussion conversationnelle, en tailles de 2, 9 et 27 milliards de paramètres.
- Gemini 2.5 Pro Experimental (2025-03-25) — Google lance Gemini 2.5 Pro Experimental, premier modèle de la famille 2.5 : un modèle de raisonnement classé premier de LMArena, fort en code, en mathématiques et en sciences, avec 1 million de tokens de contexte.
- Génération d'images GPT-4o (2025-03-25) — OpenAI intègre la génération d'images native à GPT-4o dans ChatGPT : un modèle multimodal qui rend le texte avec précision, suit des consignes détaillées et affine ses images au fil de la conversation.
- Qwen2.5-Omni (2025-03-27) — Alibaba Qwen publie Qwen2.5-Omni-7B, un modèle multimodal de bout en bout à poids ouverts : il perçoit texte, images, audio et vidéo et répond en texte ou en parole synthétisée en flux continu.
- Llama 4 (Scout, Maverick, Behemoth en aperçu) (2025-04-05) — Meta publie Llama 4 Scout et Llama 4 Maverick, ses premiers modèles à poids ouverts en mélange d'experts et nativement multimodaux, et présente Behemoth, un modèle de 2 000 milliards de paramètres encore en entraînement.
- Google lance A2A, le protocole d'agent à agent (2025-04-09) — Lors de Google Cloud Next, Google présente Agent2Agent (A2A), un protocole ouvert qui permet à des agents d'IA de fournisseurs différents de se découvrir, d'échanger et de coordonner des tâches.
- Kimi-VL (A3B Instruct et Thinking) (2025-04-10) — Moonshot AI publie Kimi-VL, un modèle vision-langage MoE de 16 milliards de paramètres (2,8 milliards actifs dans le décodeur), avec une variante de raisonnement, sous licence MIT et contexte de 128K.
- GPT-4.1, GPT-4.1 mini et GPT-4.1 nano (2025-04-14) — OpenAI lance dans l'API la famille GPT-4.1 (GPT-4.1, mini et nano), avec de meilleures performances en code et en suivi d'instructions, un contexte d'un million de tokens et un premier modèle nano.
- GLM-4-0414 (GLM-4-32B, GLM-Z1, GLM-Z1-Rumination) (2025-04-14) — Zhipu AI a publié la famille GLM-4-0414 sous licence MIT : GLM-4-32B, les modèles de raisonnement GLM-Z1 (32B et 9B) et GLM-Z1-Rumination, présentés comme comparables à GPT-4o et DeepSeek-V3/R1.
- DolphinGemma (2025-04-14) — Google, avec Georgia Tech et le Wild Dolphin Project, présente DolphinGemma, un modèle d'environ 400 millions de paramètres entraîné sur des sons de dauphins et assez léger pour tourner sur des smartphones Pixel.
- OpenAI o3 et o4-mini (2025-04-16) — OpenAI lance o3, son modèle de raisonnement le plus puissant, et o4-mini, une version rapide et économique. Pour la première fois, ces modèles peuvent combiner tous les outils de ChatGPT et raisonner sur les images.
- Gemini 2.5 Flash (aperçu) (2025-04-17) — Google lance en préversion Gemini 2.5 Flash, son premier modèle de raisonnement hybride : le raisonnement s'active ou se désactive et un budget de réflexion permet d'arbitrer entre qualité, coût et latence.
- Gemma 3 QAT (2025-04-18) — Google publie des versions de Gemma 3 entraînées avec quantification (QAT), qui réduisent fortement la mémoire vidéo nécessaire : le modèle 27B passe de 54 Go à 14,1 Go en int4 et tient sur une carte grand public.
- gpt-image-1 (2025-04-23) — OpenAI met dans l'API gpt-image-1, le modèle multimodal natif qui alimente la génération d'images de ChatGPT, pour produire et retoucher des images avec un rendu de texte fidèle et des consignes précises.
- Qwen3 (2025-04-29) — Alibaba Qwen publie Qwen3, huit modèles à poids ouverts sous Apache 2.0 (deux MoE, 235B-A22B et 30B-A3B, et six denses de 0,6B à 32B) qui combinent mode de réflexion et mode direct dans un même modèle.
- Nouveau terme : complaisance (sycophancy) (2025-04-29) — La complaisance (sycophancy) est la tendance d'un modèle à flatter l'utilisateur et à approuver ses idées, même fausses ou dangereuses, pour lui plaire. Le retrait d'une mise à jour de GPT-4o fin avril 2025 a popularisé le mot.
- MiMo-7B (2025-04-30) — Xiaomi publie MiMo-7B, sa première famille de modèles de langage à poids ouverts (MIT) : un 7 milliards de paramètres entraîné pour le raisonnement, au niveau d'o1-mini en mathématiques et en code.
- Gemini 2.5 Pro Preview (édition I/O) (2025-05-06) — Google publie en avance sur Google I/O une version améliorée de Gemini 2.5 Pro, meilleure pour le code et la création d'applications web interactives, et première du classement WebDev Arena.
- Mistral Medium 3 (2025-05-07) — Mistral AI lance Mistral Medium 3, un modèle propriétaire qui vise les usages professionnels (code, multimodal) à un coût annoncé 8 fois inférieur, pour 0,4 dollar en entrée et 2 dollars en sortie par million de tokens.
- codex-1 et codex-mini (Codex) (2025-05-16) — OpenAI lance Codex, un agent de développement dans le cloud propulsé par codex-1, une version d'o3 optimisée pour le génie logiciel, ainsi que codex-mini, une version d'o4-mini pour Codex CLI, disponible dans l'API.
- Veo 3 (2025-05-20) — Google DeepMind présente Veo 3, son modèle de génération vidéo qui produit pour la première fois l'audio avec l'image : bruits ambiants, effets sonores et dialogues synchronisés, avec un meilleur respect de la physique.
- Gemini Diffusion (2025-05-20) — Google DeepMind présente Gemini Diffusion, un modèle de recherche expérimental qui génère du texte et du code par diffusion, en transformant du bruit en texte, bien plus vite que son modèle le plus rapide.
- Gemma 3n (aperçu) (2025-05-20) — Google présente en préversion Gemma 3n, un modèle ouvert conçu pour tourner sur téléphone, tablette et ordinateur portable, qui tient dans 2 à 3 Go de mémoire malgré 5 à 8 milliards de paramètres bruts.
- Lyria 2 et Lyria RealTime (2025-05-20) — À Google I/O, Google DeepMind élargit l'accès à Lyria 2, son modèle de composition musicale, et ouvre Lyria RealTime, un modèle de musique générée en continu, via une API et Google AI Studio.
- MedGemma (2025-05-20) — Google publie MedGemma, une collection de modèles ouverts dérivés de Gemma 3 pour la santé : 4B multimodal et 27B texte à l'annonce, complétés le 9 juillet par un 27B multimodal et l'encodeur MedSigLIP.
- Google I/O 2025 (2025-05-20) — Google tient sa conférence développeurs annuelle les 20 et 21 mai 2025 : nouveaux modèles Gemini 2.5, génération vidéo avec Veo 3, mode IA dans la recherche et lunettes Android XR.
- Gemini 2.5 Flash (mise à jour du 20 mai) (2025-05-20) — À Google I/O, Google publie une version améliorée de Gemini 2.5 Flash, plus performante sur le raisonnement, le multimodal, le code et le contexte long, tout en consommant 20 à 30 % de tokens en moins.
- Gemini 2.5 Flash et Pro TTS, Gemini 2.5 Flash Native Audio (2025-05-20) — À Google I/O, Google ouvre en préversion la synthèse vocale de Gemini 2.5 Flash et 2.5 Pro (deux voix, plus de 24 langues) et une voix conversationnelle native pour l'API Live, améliorées en septembre et en décembre.
- Imagen 4 (2025-05-20) — Google DeepMind présente Imagen 4, son modèle de génération d'images de nouvelle génération : détails plus fins, rendu de texte nettement amélioré et sorties jusqu'en 2K, décliné en Standard, Ultra et Fast.
- Devstral (2025-05-21) — Mistral AI et All Hands AI publient Devstral, un modèle agentique de 24 milliards de paramètres pour l'ingénierie logicielle, sous licence Apache 2.0, qui atteint 46,8 % sur SWE-Bench Verified.
- Claude Sonnet 4 (2025-05-22) — Anthropic lance Claude Sonnet 4, mise à niveau majeure de Sonnet 3.7 avec de meilleures capacités de codage et de suivi des consignes, au même prix, et accessible aux utilisateurs gratuits.
- Mistral OCR 2 (2025-05-22) — Mistral AI sort Mistral OCR 2 (mistral-ocr-2505) avec les annotations de documents : une nouvelle version de son service OCR, plus fiable pour l'extraction de texte et de zones (bounding boxes) sur des documents variés.
- Claude Opus 4 (2025-05-22) — Anthropic lance Claude Opus 4, présenté comme son meilleur modèle de codage, capable de tâches longues sur des milliers d'étapes. Il sort avec Claude Sonnet 4 et la disponibilité générale de Claude Code.
- DeepSeek R1-0528 (2025-05-28) — DeepSeek publie R1-0528, une mise à niveau de R1 qui double la profondeur de raisonnement et fait passer AIME 2025 de 70,0 à 87,5, avec une version distillée dans Qwen3 8B.
- Nouveau terme : GEO (2025-05-28) — Le GEO (generative engine optimization, optimisation pour les moteurs génératifs) vise à faire citer une marque ou un contenu dans les réponses des assistants d'IA, comme le SEO vise le classement dans les moteurs de recherche.
- Codestral Embed (2025-05-28) — Mistral AI lance Codestral Embed, son premier modèle d'embedding spécialisé dans le code, annoncé au-dessus de Voyage Code 3, Cohere Embed v4.0 et du grand modèle d'embedding d'OpenAI pour la recherche de code.
- Gemini 2.5 Pro Preview (06-05) (2025-06-05) — Google publie une version améliorée de Gemini 2.5 Pro en préversion, avant sa disponibilité générale : gain de 24 points Elo sur LMArena, meilleur style de réponse et budgets de réflexion.
- o3-pro (2025-06-10) — OpenAI lance o3-pro, une version d'o3 qui réfléchit plus longtemps pour des réponses plus fiables, disponible pour les abonnés Pro et Team de ChatGPT et dans l'API, en même temps qu'une baisse de prix d'o3.
- Magistral (2025-06-10) — Mistral AI présente Magistral, sa première famille de modèles de raisonnement : Magistral Small (24B, Apache 2.0) et Magistral Medium (version entreprise), avec un raisonnement traçable et multilingue.
- Meta investit 14,3 Md USD dans Scale AI (2025-06-12) — Meta prend 49 % de Scale AI, spécialiste de l'annotation de données, pour environ 14,3 Md USD et recrute son fondateur Alexandr Wang : le coup d'envoi d'une guerre des talents sans précédent dans l'IA.
- MiniMax-M1 (2025-06-16) — MiniMax publie MiniMax-M1, présenté comme le premier modèle de raisonnement ouvert à grande échelle à attention hybride : 456 milliards de paramètres, 1 million de tokens de contexte, licence Apache 2.0.
- Gemini 2.5 Pro (disponibilité générale) (2025-06-17) — Google déclare Gemini 2.5 Pro stable et généralement disponible, sans changement par rapport à la préversion du 5 juin, avec raisonnement adaptatif et budgets de réflexion pour un usage en production.
- Gemini 2.5 Flash-Lite (2025-06-17) — Google lance Gemini 2.5 Flash-Lite, le modèle le moins cher et le plus rapide de la famille 2.5 : préversion le 17 juin 2025, version stable le 22 juillet à 0,10 USD en entrée et 0,40 USD en sortie.
- Gemini 2.5 Flash (disponibilité générale) (2025-06-17) — Google rend Gemini 2.5 Flash stable et disponible en production, en supprimant la différence de prix entre raisonnement actif et inactif et en gardant un seul palier tarifaire quelle que soit la taille de l'entrée.
- Nouveau terme : context engineering (2025-06-19) — Le context engineering (ingénierie du contexte) consiste à fournir à un modèle tout ce dont il a besoin pour réussir une tâche : consignes, documents, historique, outils, mémoire. Le terme prolonge et remplace en partie le prompt engineering.
- Mistral Small 3.2 (2025-06-20) — Mistral AI publie Mistral Small 3.2 (24B), une mise à jour mineure de Small 3.1 sous licence Apache 2.0 : meilleur suivi des instructions, moins de répétitions et un appel de fonctions plus robuste.
- Gemini Robotics On-Device (2025-06-24) — Google DeepMind présente Gemini Robotics On-Device, son modèle vision-langage-action optimisé pour tourner sur le robot lui-même, adaptable à de nouvelles tâches avec 50 à 100 démonstrations.
- o3-deep-research et o4-mini-deep-research (2025-06-26) — OpenAI ouvre dans l'API deux modèles de recherche approfondie, o3-deep-research et o4-mini-deep-research, dérivés des modèles de raisonnement o3 et o4-mini pour analyser et synthétiser des sources web et privées.
- Gemma 3n (2025-06-26) — Google publie la version complète de Gemma 3n, modèle ouvert multimodal pour appareils mobiles en tailles effectives E2B et E4B, qui accepte texte, image, audio et vidéo en entrée et dépasse 1 300 Elo sur LMArena.
- Hunyuan-A13B (2025-06-27) — Tencent ouvre Hunyuan-A13B, un modèle à experts (MoE) de 80 milliards de paramètres dont 13 milliards actifs, à raisonnement hybride rapide ou lent et contexte de 256 000 tokens, sous licence communautaire Tencent.
- Hackathon Agents IA (2025-06-27) — Deuxième édition du hackathon interne, cette fois focalisé sur les agents IA. 48h pour créer des solutions innovantes d'automatisation.
- ERNIE 4.5 (2025-06-30) — Baidu ouvre toute la famille ERNIE 4.5 sous licence Apache 2.0 : dix modèles, du dense de 0,3 milliard aux MoE multimodaux à 47 milliards de paramètres actifs, le plus grand totalisant 424 milliards.
- Cloudflare bloque par défaut les robots d'IA (2025-07-01) — Cloudflare, qui voit passer environ 20 % du trafic web, inverse la règle : l'exploration par les robots d'IA exige désormais l'accord du site, et un paiement à l'exploration (« pay per crawl ») est testé en bêta privée.
- Grok 4 (2025-07-09) — xAI lance Grok 4, présenté comme son modèle le plus intelligent, avec usage natif d'outils, recherche en temps réel et une fenêtre de contexte de 256 000 tokens dans l'API.
- Grok 4 Heavy (2025-07-09) — xAI présente Grok 4 Heavy, la version la plus puissante de Grok 4 fondée sur du calcul parallèle au moment de l'inférence, accessible via le nouvel abonnement SuperGrok Heavy.
- T5Gemma (2025-07-09) — Google publie T5Gemma, une collection de modèles encodeur-décodeur obtenus en convertissant des modèles Gemma 2 décodeur seul, avec des combinaisons de tailles déséquilibrées comme un encodeur 9B et un décodeur 2B.
- Devstral Medium (2025-07-10) — Mistral AI lance Devstral Medium, un modèle de code agentique disponible par API et en déploiement privé, à 61,6 % sur SWE-Bench Verified, présenté comme supérieur à Gemini 2.5 Pro et GPT-4.1 pour un quart du prix.
- Code de bonnes pratiques européen pour l'IA à usage général (2025-07-10) — La Commission publie le code de bonnes pratiques pour les modèles d'IA à usage général : un outil volontaire, en trois chapitres, qui permet aux fournisseurs de démontrer leur conformité à l'AI Act avant l'échéance du 2 août 2025.
- Devstral Small 1.1 (2025-07-10) — Mistral AI publie Devstral Small 1.1, une mise à jour de son modèle ouvert de code agentique (24B, Apache 2.0) qui passe de 46,8 % à 53,6 % sur SWE-Bench Verified et gère mieux les scaffolds variés.
- Kimi K2 (2025-07-11) — Moonshot AI publie Kimi K2, un modèle MoE de 1000 milliards de paramètres (32 milliards actifs) à poids ouverts sous licence MIT modifiée, entraîné avec l'optimiseur MuonClip et conçu pour les usages agentiques.
- Nouveau terme : spec-driven development (2025-07-14) — Le développement piloté par les spécifications (spec-driven development) fait rédiger exigences, conception et plan de tâches avant tout code : la spécification devient la source de vérité que l'agent exécute. Kiro (AWS) l'a lancé en juillet 2025.
- Nouveau terme : context rot (2025-07-14) — Le context rot (dégradation du contexte) désigne la baisse de fiabilité d'un modèle à mesure que son contexte s'allonge, même sur des tâches simples et bien en deçà de la taille maximale de sa fenêtre.
- Nouveau terme : boucle Ralph Wiggum (2025-07-14) — La boucle Ralph Wiggum (Ralph loop) relance sans fin un agent de code avec la même consigne jusqu'à ce que la tâche soit terminée et vérifiée. Imaginée par Geoffrey Huntley en juillet 2025, la technique devient virale fin 2025 et début 2026.
- Voxtral (2025-07-15) — Mistral AI lance Voxtral, ses premiers modèles de compréhension de la parole : Small (24B) et Mini (3B), sous Apache 2.0, pour transcrire et interroger l'audio, à partir de 0,001 dollar la minute.
- Médaille d'or aux Olympiades de mathématiques pour OpenAI et Google DeepMind (2025-07-19) — Deux modèles de langage généralistes, l'un d'OpenAI, l'autre de Google DeepMind, obtiennent 35 points sur 42 aux Olympiades internationales de mathématiques 2025, soit le niveau de la médaille d'or, en rédigeant leurs preuves en langage naturel.
- Qwen3-2507 (Qwen3-235B-A22B Instruct et Thinking) (2025-07-21) — Alibaba Qwen publie Qwen3-235B-A22B-Instruct-2507 (21 juillet) puis Qwen3-235B-A22B-Thinking-2507 (25 juillet) : deux mises à jour du MoE 235B, avec contexte natif de 262 144 tokens, sous Apache 2.0.
- Qwen3-Coder (2025-07-22) — Alibaba Qwen publie Qwen3-Coder-480B-A35B-Instruct, un MoE de 480 milliards de paramètres (35 milliards actifs) sous Apache 2.0, dédié au code agentique, avec l'outil en ligne de commande Qwen Code.
- Plan d'action américain pour l'IA (2025-07-23) — La Maison-Blanche publie « Winning the AI Race: America's AI Action Plan » (gagner la course à l'IA), plus de 90 mesures fédérales pour accélérer l'innovation, construire l'infrastructure et exporter la technologie américaine.
- GLM-4.5 et GLM-4.5-Air (2025-07-28) — Z.ai (ex-Zhipu AI) a publié GLM-4.5 (355B paramètres, 32B actifs) et GLM-4.5-Air (106B, 12B actifs), deux modèles MoE à raisonnement hybride pour agents et code, sous licence MIT.
- Codestral 25.08 (2025-07-30) — Mistral AI annonce Codestral 25.08, mise à jour de son modèle de complétion de code (+30 % de complétions acceptées, 50 % de générations incontrôlées en moins), au sein d'une pile de codage pour l'entreprise.
- Step3 (2025-07-31) — StepFun ouvre Step3, un modèle multimodal à experts de 321 milliards de paramètres dont 38 actifs, sous Apache 2.0, conçu avec son système d'inférence pour réduire le coût du décodage sur des GPU variés.
- Gemini 2.5 Deep Think (2025-08-01) — Google déploie Gemini 2.5 Deep Think pour les abonnés Google AI Ultra : un mode de raisonnement à pensée parallèle, variante plus rapide du modèle médaillé d'or à l'Olympiade internationale de mathématiques.
- AI Act : obligations des modèles d'usage général applicables (2025-08-02) — Deuxième étape de l'AI Act : depuis le 2 août 2025, les fournisseurs de modèles d'IA à usage général mis sur le marché européen doivent documenter leurs modèles, respecter le droit d'auteur et publier un résumé de leurs données d'entraînement.
- gpt-oss-120b et gpt-oss-20b (2025-08-05) — OpenAI publie gpt-oss-120b et gpt-oss-20b, ses premiers modèles de langage à poids ouverts depuis GPT-2, sous licence Apache 2.0, conçus pour le raisonnement, l'usage d'outils et un déploiement sur du matériel courant.
- Genie 3 (2025-08-05) — Google DeepMind annonce Genie 3, un modèle de monde généraliste qui crée des environnements interactifs navigables en temps réel à 24 images par seconde, en 720p, à partir d'une simple invite texte.
- Claude Opus 4.1 (2025-08-05) — Anthropic publie Claude Opus 4.1, mise à jour d'Opus 4 avec de meilleures performances en codage, en agents et en raisonnement, au même prix. L'éditeur recommande de migrer depuis Opus 4 pour tous les usages.
- GPT-5 (2025-08-07) — OpenAI lance GPT-5, un système unifié qui associe un modèle rapide, un modèle de raisonnement approfondi et un routeur, avec des versions mini, nano et pro pour l'API, devenu le modèle par défaut de ChatGPT.
- Mistral Medium 3.1 (2025-08-12) — Mistral AI publie Mistral Medium 3.1 (mistral-medium-2508), une mise à jour de Medium 3 annoncée avec un gain global de performance, un meilleur ton et des recherches web plus pertinentes, par API et dans Le Chat.
- Gemma 3 270M (2025-08-14) — Google publie Gemma 3 270M, un modèle ouvert de 270 millions de paramètres conçu pour le réglage fin de tâches précises, très économe en énergie et capable de suivre des instructions dès l'installation.
- NVIDIA Nemotron Nano 2 et Nemotron-Pretraining v1 (2025-08-18) — NVIDIA publie Nemotron Nano 2 (9B et 12B), un modèle de raisonnement hybride Mamba-Transformer, avec la majeure partie de son corpus de préentraînement (6 600 milliards de tokens).
- Seed-OSS-36B (2025-08-20) — ByteDance publie Seed-OSS-36B, son premier grand modèle généraliste à poids ouverts : un dense de 36 milliards de paramètres, contexte natif de 512 000 tokens et budget de réflexion réglable, sous Apache 2.0.
- Lancement Plateforme IA (2025-08-20) — Lancement officiel de la plateforme IA interne ASTEK. Centralisation des outils, agents et modèles pour tous les collaborateurs.
- DeepSeek V3.1 (2025-08-21) — DeepSeek publie V3.1, un modèle de 671 milliards de paramètres qui réunit en un seul jeu de poids un mode réflexion et un mode sans réflexion, avec de nettes avancées pour les agents de code et de recherche.
- Gemini 2.5 Flash Image (Nano Banana) (2025-08-26) — Google lance Gemini 2.5 Flash Image, surnommé Nano Banana, son modèle d'édition et de génération d'images : fusion d'images, cohérence des personnages, retouches ciblées en langage naturel et connaissance du monde.
- Nouveau terme : vibe hacking (2025-08-27) — Le vibe hacking désigne l'usage d'agents de code par des attaquants qui fixent un objectif général et laissent l'IA mener elle-même reconnaissance, intrusion et extorsion. Anthropic l'a popularisé en août 2025.
- gpt-realtime (2025-08-28) — OpenAI rend l'API Realtime généralement disponible et lance gpt-realtime, son modèle de parole à parole le plus avancé, avec un meilleur suivi d'instructions, des appels d'outils plus précis et des voix plus naturelles.
- Grok Code Fast 1 (2025-08-28) — xAI lance grok-code-fast-1, un modèle de raisonnement rapide et économique conçu pour le codage agentique, disponible dans l'API et gratuitement à durée limitée chez plusieurs partenaires.
- LongCat-Flash-Chat (2025-09-01) — Meituan ouvre LongCat-Flash-Chat, un modèle à experts de 560 milliards de paramètres dont 18,6 à 31,3 milliards actifs selon le contexte, sous licence MIT, très rapide en inférence et fort en tâches d'agents.
- EmbeddingGemma (2025-09-04) — Google publie EmbeddingGemma, un modèle d'embeddings ouvert de 308 millions de paramètres pour les usages sur appareil : premier du classement MTEB parmi les modèles multilingues de moins de 500 M.
- Anthropic règle 1,5 Md USD aux auteurs (affaire Bartz) (2025-09-05) — Poursuivie pour avoir téléchargé des livres piratés, Anthropic accepte de verser au moins 1,5 Md USD aux auteurs et éditeurs, soit environ 3 000 USD par œuvre : le plus important règlement connu en matière de droit d'auteur aux États-Unis.
- Mistral AI lève 1,7 Md€, ASML investisseur principal (2025-09-09) — Mistral AI boucle une série C de 1,7 Md€ menée par le néerlandais ASML, qui apporte 1,3 Md€. La start-up française est valorisée 11,7 Md€, un rapprochement européen entre IA et semi-conducteurs.
- Qwen3-Next (2025-09-11) — Alibaba Qwen présente Qwen3-Next-80B-A3B, un MoE ultra-parcimonieux de 80 milliards de paramètres (3 milliards actifs) à attention hybride, publié en versions Instruct et Thinking sous Apache 2.0.
- VaultGemma (2025-09-12) — Google Research et DeepMind publient VaultGemma, un modèle ouvert d'un milliard de paramètres, le plus grand pré-entraîné à partir de zéro avec confidentialité différentielle, et des lois d'échelle associées.
- GPT-5-Codex (2025-09-15) — OpenAI publie GPT-5-Codex, une version de GPT-5 optimisée pour le développement agentique dans Codex, capable de séances interactives rapides comme de longues tâches autonomes, avec une capacité de revue de code.
- Magistral 1.2 (2025-09-17) — Mistral AI publie Magistral Medium 1.2 et Magistral Small 1.2, qui ajoutent un encodeur de vision (raisonnement multimodal) et améliorent nettement les scores de raisonnement, Small restant sous licence Apache 2.0.
- Grok 4 Fast (2025-09-19) — xAI lance Grok 4 Fast, un modèle de raisonnement économique avec une fenêtre de contexte de 2 millions de tokens et une architecture unifiée raisonnement et non-raisonnement.
- Qwen3-Omni (2025-09-22) — Alibaba Qwen publie Qwen3-Omni-30B-A3B, un modèle omni-modal MoE à poids ouverts (Instruct, Thinking et Captioner) qui traite texte, image, audio et vidéo et répond en texte ou en parole en flux continu.
- Nouveau terme : workslop (2025-09-22) — Le workslop désigne des livrables professionnels générés par IA qui ont l'apparence d'un bon travail mais pas la substance : le destinataire doit les corriger ou les refaire. Le terme vient d'un article de la Harvard Business Review de septembre 2025.
- Nvidia annonce jusqu'à 100 Md USD d'investissement dans OpenAI (2025-09-22) — Nvidia et OpenAI signent une lettre d'intention : au moins 10 GW de systèmes Nvidia pour OpenAI et jusqu'à 100 Md USD investis par Nvidia au fil des déploiements. L'accord, non contraignant, sera remplacé début 2026 par une prise de participation plus modeste.
- Qwen3-VL (2025-09-23) — Alibaba Qwen publie Qwen3-VL-235B-A22B en versions Instruct et Thinking sous Apache 2.0, puis une famille de tailles denses et MoE (2B à 32B, 30B-A3B) ; contexte natif de 256 000 tokens et agent visuel.
- Code World Model (CWM) 32B (2025-09-24) — Meta FAIR publie Code World Model (CWM), un modèle dense de 32 milliards de paramètres à poids ouverts pour la recherche, entraîné à simuler l'exécution de code et à résoudre des tâches d'ingénierie logicielle.
- Gemini Robotics 1.5 et Gemini Robotics-ER 1.5 (2025-09-25) — Google DeepMind lance Gemini Robotics 1.5, un modèle vision-langage-action qui réfléchit avant d'agir, et Robotics-ER 1.5, modèle de raisonnement spatial ouvert aux développeurs en préversion via l'API Gemini.
- Gemini 2.5 Flash et Flash-Lite (préversions 09-2025) (2025-09-25) — Google publie des versions améliorées en préversion de Gemini 2.5 Flash et Flash-Lite, avec une consommation de tokens de sortie réduite de 24 % et de 50 %, et introduit les alias « -latest ».
- DeepSeek V3.2-Exp (2025-09-29) — DeepSeek publie V3.2-Exp, version expérimentale qui introduit l'attention éparse DSA pour rendre le contexte long moins coûteux, à qualité équivalente à V3.1-Terminus, avec des prix API divisés par plus de deux.
- Claude Sonnet 4.5 (2025-09-29) — Anthropic lance Claude Sonnet 4.5, présenté comme son meilleur modèle de codage et d'agents, capable de rester concentré plus de 30 heures. Le Claude Agent SDK est publié le même jour.
- Nouveau terme : agent harness (2025-09-29) — Le harness d'agent (agent harness) désigne tout ce qui entoure un modèle pour en faire un agent : boucle d'exécution, outils, gestion du contexte, mémoire, permissions et vérifications. Anthropic a popularisé le terme avec le Claude Agent SDK, fin septembre 2025.
- Californie : loi SB 53 sur les modèles d'IA de pointe (2025-09-29) — Gavin Newsom promulgue la loi SB 53 (Transparency in Frontier Artificial Intelligence Act) : les grands développeurs de modèles de pointe doivent publier leur cadre de gestion des risques et signaler les incidents critiques.
- Nouveau terme : agentic commerce (2025-09-29) — Le commerce agentique (agentic commerce) désigne les achats effectués par un agent d'IA au nom de l'utilisateur, de la recherche du produit jusqu'au paiement. OpenAI et Stripe l'ont popularisé le 29 septembre 2025 avec Instant Checkout et l'Agentic Commerce Protocol.
- GLM-4.6 (2025-09-30) — Z.ai a publié GLM-4.6, mise à jour de GLM-4.5 : contexte porté de 128K à 200K tokens, meilleur code agentique, raisonnement avec outils, poids ouverts sous licence MIT.
- Sora 2 (2025-09-30) — OpenAI lance Sora 2, son modèle phare de génération de vidéo et d'audio synchronisé, avec une physique plus crédible et un meilleur contrôle, ainsi qu'une application iOS sociale Sora sur invitation.
- gpt-realtime-mini, gpt-audio-mini et gpt-image-1-mini (2025-10-06) — Lors du DevDay, OpenAI ouvre dans l'API trois modèles plus économiques : gpt-realtime-mini et gpt-audio-mini pour la parole à parole, et gpt-image-1-mini pour la génération d'images.
- Gemini 2.5 Computer Use (2025-10-07) — Google DeepMind publie en préversion Gemini 2.5 Computer Use, un modèle spécialisé bâti sur Gemini 2.5 Pro qui pilote des interfaces graphiques (clics, saisie, défilement), surtout des navigateurs.
- Ling-1T (2025-10-09) — Ant Group, via son équipe inclusionAI, ouvre Ling-1T, un modèle de langage à 1 billion de paramètres (environ 50 milliards actifs), non raisonneur, sous licence MIT, entraîné en précision FP8.
- Ring-1T (2025-10-14) — Ant Group ouvre Ring-1T, un modèle de raisonnement de 1 billion de paramètres (50 milliards actifs) sous licence MIT, qui atteint le niveau argent à l'Olympiade internationale de mathématiques 2025 en langage naturel.
- Veo 3.1 (2025-10-15) — Google lance Veo 3.1 et Veo 3.1 Fast en préversion payante dans l'API Gemini : audio natif plus riche, meilleur contrôle narratif, références d'images, extension de scènes et transitions entre première et dernière image.
- Claude Haiku 4.5 (2025-10-15) — Anthropic lance Claude Haiku 4.5, un modèle rapide qui offre des performances de codage proches de Sonnet 4 pour un tiers du coût et plus de deux fois la vitesse, sous ASL-2.
- C2S-Scale 27B (Cell2Sentence-Scale) (2025-10-15) — Google DeepMind et Yale publient C2S-Scale 27B, un modèle de fondation de 27 milliards de paramètres pour l'analyse de cellules individuelles, bâti sur la famille ouverte Gemma, qui a proposé une piste thérapeutique validée en laboratoire.
- Agent Skills : Anthropic lance les compétences d'agent (2025-10-16) — Anthropic introduit les Agent Skills : des dossiers d'instructions, de scripts et de ressources, décrits par un fichier SKILL.md, que Claude charge seulement quand une tâche en a besoin. Le format devient un standard ouvert le 18 décembre 2025.
- MiniMax-M2 (2025-10-27) — MiniMax publie MiniMax-M2, un MoE compact de 230 milliards de paramètres dont 10 milliards actifs, conçu pour le code et les agents, sous licence MIT modifiée, à 0,30 $ / 1,20 $ le million de tokens.
- OpenAI devient une société à mission ; Microsoft détient environ 27 % (2025-10-28) — OpenAI achève sa recapitalisation : son activité commerciale devient OpenAI Group PBC, contrôlée par la fondation OpenAI qui en détient 26 %. Microsoft conserve environ 27 %, valorisés près de 135 Md USD, et un nouvel accord encadre leur partenariat.
- Nvidia, première entreprise à 5 000 Md USD de capitalisation (2025-10-29) — Le 29 octobre 2025, Nvidia devient la première entreprise cotée à dépasser 5 000 Md USD de capitalisation et à clôturer au-dessus de ce seuil, trois mois seulement après avoir franchi les 4 000 Md USD.
- gpt-oss-safeguard (2025-10-29) — OpenAI publie en aperçu gpt-oss-safeguard-120b et 20b, des modèles de raisonnement à poids ouverts qui classent des contenus selon une politique de sécurité fournie par le développeur à l'inférence.
- Kimi Linear (48B-A3B) (2025-10-30) — Moonshot AI publie Kimi Linear, un MoE de 48 milliards de paramètres (3 milliards actifs) à attention hybride linéaire (Kimi Delta Attention), qui réduit le cache KV jusqu'à 75 % et accélère le décodage jusqu'à 6 fois.
- Kimi K2 Thinking (2025-11-06) — Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement agentique ouvert de 1000 milliards de paramètres, capable de 200 à 300 appels d'outils enchaînés et quantifié nativement en INT4.
- ERNIE-4.5-VL-28B-A3B-Thinking (2025-11-11) — Baidu publie ERNIE-4.5-VL-28B-A3B-Thinking, un modèle vision-langage de 28 milliards de paramètres dont 3 milliards actifs, sous licence Apache 2.0, qui raisonne sur les images et tient sur un seul GPU de 80 Go.
- GPT-5.1 (2025-11-12) — OpenAI lance GPT-5.1 avec deux modèles dans ChatGPT, GPT-5.1 Instant et GPT-5.1 Thinking, plus chaleureux et plus fiables, puis les propose dans l'API le lendemain avec un raisonnement adaptatif.
- Grok 4.1 (2025-11-17) — xAI déploie Grok 4.1 pour tous les utilisateurs de grok.com, X et des applications mobiles, avec une personnalité plus cohérente, plus d'intelligence émotionnelle et moins d'hallucinations.
- Gemini 3 Pro (2025-11-18) — Google lance Gemini 3 Pro, son modèle le plus intelligent : premier de LMArena (1 501 Elo), fort en raisonnement, multimodalité et codage agentique, en préversion dans l'API Gemini, Vertex AI et l'application.
- Grok 4.1 Fast et Agent Tools API (2025-11-19) — xAI lance Grok 4.1 Fast, son meilleur modèle d'appel d'outils avec 2 millions de tokens de contexte, et l'Agent Tools API pour construire des agents autonomes avec outils exécutés côté serveur.
- GPT-5.1-Codex-Max (2025-11-19) — OpenAI lance GPT-5.1-Codex-Max, son nouveau modèle de développement agentique, entraîné à travailler sur plusieurs fenêtres de contexte grâce à la compaction, pour des tâches de plusieurs heures.
- Omnibus numérique : la Commission propose de reporter une partie de l'AI Act (2025-11-19) — Dans son « omnibus numérique », la Commission propose de reporter l'application des règles de l'AI Act sur les systèmes à haut risque, faute de normes prêtes. Le texte, adopté en 2026, fixe les échéances à décembre 2027 et août 2028.
- Nano Banana Pro (Gemini 3 Pro Image) (2025-11-20) — Google lance Nano Banana Pro (Gemini 3 Pro Image), modèle d'images bâti sur Gemini 3 Pro : texte lisible, ancrage par la recherche Google, sorties 2K et 4K, cohérence de jusqu'à 5 personnes.
- Olmo 3 (7B et 32B) et Olmo 3.1 (2025-11-20) — Ai2 publie Olmo 3 (7B et 32B), entièrement ouvert : données, code, poids et points de contrôle. Olmo 3-Think 32B est présenté comme le meilleur modèle de raisonnement 32B entièrement ouvert.
- Claude Opus 4.5 (2025-11-24) — Anthropic lance Claude Opus 4.5, son modèle le plus performant en codage, agents et usage d'ordinateur, avec un prix divisé par trois (5 / 25 USD) et un nouveau paramètre d'effort.
- DeepSeek V3.2 (2025-12-01) — DeepSeek publie V3.2 et V3.2-Speciale : le premier atteint le niveau de GPT-5 selon l'éditeur, la seconde rivalise avec Gemini 3 Pro et décroche l'or à l'IMO et à l'IOI 2025.
- Ministral 3 (2025-12-02) — Mistral AI publie Ministral 3, une gamme de modèles denses de 3B, 8B et 14B paramètres, multimodaux, multilingues et sous licence Apache 2.0, en variantes base, instruct et raisonnement, pensée pour l'edge et le local.
- Mistral Large 3 (2025-12-02) — Mistral AI lance Mistral Large 3, son modèle le plus capable : un mélange d'experts multimodal de 675 milliards de paramètres (41 milliards actifs), sous licence Apache 2.0, avec un contexte de 256k tokens.
- Gemini 3 Deep Think (2025-12-04) — Google déploie le mode Gemini 3 Deep Think dans l'application Gemini pour les abonnés Google AI Ultra : raisonnement parallèle sur les problèmes de mathématiques, de sciences et de logique les plus difficiles.
- Devstral 2 (2025-12-09) — Mistral AI lance Devstral 2, un modèle dense de 123 milliards de paramètres pour les agents de code, à 72,2 % sur SWE-bench Verified, sous licence MIT modifiée, avec l'interface en ligne de commande Mistral Vibe.
- Devstral Small 2 (2025-12-09) — Mistral AI publie Devstral Small 2, un modèle de code agentique de 24 milliards de paramètres sous licence Apache 2.0, à 68,0 % sur SWE-bench Verified, capable de tourner en local sur du matériel grand public.
- Agentic AI Foundation : MCP, AGENTS.md et goose confiés à la Linux Foundation (2025-12-09) — La Linux Foundation crée l'Agentic AI Foundation (AAIF), qui accueille le Model Context Protocol d'Anthropic, AGENTS.md d'OpenAI et goose de Block : les briques ouvertes des agents passent sous gouvernance neutre.
- GPT-5.2 (2025-12-11) — OpenAI lance GPT-5.2, sa série de modèles la plus capable pour le travail de connaissance professionnel, avec des versions Instant, Thinking et Pro, meilleure en tableurs, présentations, code, vision et contextes longs.
- NVIDIA Nemotron 3 (Nano 30B-A3B) (2025-12-15) — NVIDIA présente la famille Nemotron 3 (Nano, Super, Ultra) et publie Nano, un MoE hybride de 30 milliards de paramètres dont 3 milliards actifs, avec poids, jeux de données et recettes d'entraînement.
- L'IA domine les mots de l'année 2025 : « slop » et « vibe coding » (2025-12-15) — Le 15 décembre 2025, Merriam-Webster élit « slop », les contenus de piètre qualité produits en masse par l'IA, mot de l'année. Collins avait couronné « vibe coding » et Macquarie « AI slop » : l'IA générative s'installe dans la langue courante.
- Molmo 2 (4B, 8B et Molmo2-O 7B) (2025-12-16) — Ai2 publie Molmo 2, une famille de modèles multimodaux ouverts pour la vidéo, les images multiples et le pointage, en versions 4B et 8B (base Qwen 3) et Molmo2-O 7B (base Olmo).
- GPT Image 1.5 (2025-12-16) — OpenAI lance un nouveau ChatGPT Images propulsé par GPT Image 1.5, son modèle d'images phare, plus précis dans les retouches, plus fidèle aux consignes et jusqu'à quatre fois plus rapide, disponible aussi dans l'API.
- MiMo-V2-Flash (2025-12-16) — Xiaomi publie MiMo-V2-Flash, un modèle à poids ouverts (MIT) de 309 milliards de paramètres dont 15 actifs, conçu pour les agents et le code, avec une attention hybride qui réduit le cache d'environ six fois.
- Mistral OCR 3 (2025-12-17) — Mistral AI lance Mistral OCR 3, un modèle d'extraction documentaire qui gagne 74 % des comparaisons face à OCR 2 sur les formulaires, scans, tableaux complexes et écriture manuscrite, à 2 dollars les 1000 pages.
- Grok Voice Agent API (2025-12-17) — xAI lance l'API Grok Voice Agent pour créer des agents vocaux multilingues avec appels d'outils et données en temps réel, à un tarif forfaitaire de 0,05 $ la minute.
- Gemini 3 Flash (2025-12-17) — Google lance Gemini 3 Flash, un modèle qui associe le raisonnement de niveau Pro de Gemini 3 à la vitesse et au coût d'un Flash : 0,50 USD en entrée et 3 USD en sortie par million de tokens.
- GPT-5.2-Codex (2025-12-18) — OpenAI publie GPT-5.2-Codex, sa version de GPT-5.2 la plus avancée pour le développement agentique, meilleure sur les refontes et migrations de grande taille, sous Windows et en cybersécurité.
- T5Gemma 2 (2025-12-18) — Google publie T5Gemma 2, la nouvelle génération de ses modèles encodeur-décodeur basée sur Gemma 3 : les premiers modèles encodeur-décodeur multimodaux et à long contexte, en trois tailles compactes.
- FunctionGemma (2025-12-18) — Google publie FunctionGemma, une version de Gemma 3 270M spécialisée dans l'appel de fonctions, avec sa recette d'entraînement, pour construire des agents locaux et privés qui traduisent le langage naturel en appels d'API.
- Meetup Bilan IA 2025 (2025-12-18) — Grand meetup de fin d'année pour faire le bilan de l'année IA 2025. Rétrospective, démos et perspectives 2026.
- GLM-4.7 (et GLM-4.7-Flash) (2025-12-22) — Z.ai a publié GLM-4.7, modèle ouvert orienté code (73,8 % sur SWE-bench Verified), avec pensée entre les actions, pensée préservée entre les tours et contrôle de la réflexion par tour, sous licence MIT.
- MiniMax-M2.1 (2025-12-23) — MiniMax publie M2.1, mise à jour de M2 axée sur la programmation multilingue (Rust, Java, Go, C++, Kotlin), le développement mobile et la réflexion entrelacée, avec 74,0 sur SWE-bench Verified.
- Apple choisit Gemini pour Siri et Apple Intelligence (2026-01-12) — Apple et Google annoncent un partenariat pluriannuel : la prochaine génération des Apple Foundation Models reposera sur les modèles Gemini et le cloud de Google, notamment pour le nouveau Siri personnalisé attendu en 2026.
- MedGemma 1.5 4B (2026-01-13) — Google Research publie MedGemma 1.5 4B, modèle ouvert de santé qui gère désormais l'imagerie 3D (scanner, IRM), l'histopathologie et le suivi de radios thoraciques, avec le modèle de dictée MedASR.
- TranslateGemma (2026-01-15) — Google publie TranslateGemma, une famille de modèles ouverts de traduction en 4B, 12B et 27B paramètres construits sur Gemma 3, évalués sur 55 langues et conçus pour tourner sur laptop ou mobile.
- Kimi K2.5 (2026-01-27) — Moonshot AI publie Kimi K2.5, un modèle ouvert multimodal natif de 1000 milliards de paramètres, prolongeant K2 sur 15 T tokens image et texte, avec un essaim d'agents jusqu'à 100 sous-agents.
- SERA (agents de code ouverts 8B, 14B, 32B) (2026-01-27) — Ai2 publie SERA, une famille d'agents de code ouverts (8B, 14B, 32B, base Qwen 3) avec poids, code, données synthétiques et une CLI, entraînés à faible coût grâce à une génération de données à vérification souple.
- Step 3.5 Flash (2026-01-29) — StepFun ouvre Step 3.5 Flash, un modèle à experts de 196 milliards de paramètres dont 11 milliards actifs, sous Apache 2.0, avec 256 000 tokens de contexte et une génération de 100 à 300 tokens par seconde.
- Grok Imagine 1.0 (2026-02-01) — xAI lance Grok Imagine 1.0, sa version la plus aboutie de génération vidéo : clips de 10 secondes en 720p avec un son nettement amélioré, présentée par l'entreprise comme son plus grand bond.
- SpaceX acquiert xAI (2026-02-02) — SpaceX annonce le 2 février 2026 l'acquisition de xAI (Grok, X) par échange d'actions, pour une valorisation combinée d'environ 1 250 milliards de dollars, la plus grande fusion connue.
- Qwen3-Coder-Next (2026-02-03) — Alibaba (équipe Qwen) publie Qwen3-Coder-Next, un modèle de code à poids ouverts de 80 milliards de paramètres dont 3 milliards actifs, pensé pour les agents de code, sous Apache 2.0.
- Voxtral Transcribe 2 (2026-02-04) — Mistral AI lance Voxtral Transcribe 2, deux modèles de transcription vocale : Voxtral Mini Transcribe V2 en mode batch et Voxtral Realtime en temps réel, ce dernier sous licence Apache 2.0.
- Nouveau terme : agentic engineering (2026-02-04) — L'agentic engineering (ingénierie agentique) désigne le développement logiciel professionnel où l'on orchestre et supervise des agents qui écrivent le code, sans rien céder sur la qualité. Andrej Karpathy l'adopte en février 2026 pour succéder au vibe coding.
- Nouveau terme : harness engineering (2026-02-05) — Le harness engineering consiste à concevoir l'environnement d'un agent (consignes, outils, tests, contrôles) pour qu'une erreur corrigée ne se reproduise plus. Mitchell Hashimoto nomme la pratique en février 2026 ; OpenAI la popularise six jours plus tard.
- GPT-5.3-Codex (2026-02-05) — OpenAI lance GPT-5.3-Codex, son modèle de code agentique le plus capable, qui combine les performances de GPT-5.2-Codex et le raisonnement de GPT-5.2 et s'exécute 25 % plus vite.
- Claude Opus 4.6 (2026-02-05) — Anthropic lance Claude Opus 4.6, son modèle le plus capable à date, meilleur en codage, en tâches agentiques longues et en fiabilité sur de grandes bases de code, avec une fenêtre de 1 M de tokens en bêta.
- Ring-2.5-1T (2026-02-10) — Ant Group ouvre Ring-2.5-1T, un modèle de raisonnement de 1 billion de paramètres à attention linéaire hybride, sous licence MIT, qui atteint le niveau or à l'OMI 2025 et au CMO 2025 selon l'éditeur.
- GPT-5.3-Codex-Spark (2026-02-12) — OpenAI présente GPT-5.3-Codex-Spark, une version réduite de GPT-5.3-Codex pensée pour le code en temps réel, servie sur puces Cerebras à plus de 1 000 tokens par seconde.
- Gemini 3 Deep Think (mise à niveau majeure) (2026-02-12) — Google met à jour Gemini 3 Deep Think, son mode de raisonnement spécialisé pour la science, la recherche et l'ingénierie, avec de nouveaux records sur ARC-AGI-2 et Humanity's Last Exam.
- GLM-5 (2026-02-12) — Z.ai a publié GLM-5, modèle MoE de 744B paramètres (40B actifs) entraîné sur 28,5T tokens, avec DeepSeek Sparse Attention et un RL asynchrone, sous licence MIT, visant l'ingénierie de systèmes et les agents longs.
- Anthropic lève 30 Md USD pour une valorisation de 380 Md USD (2026-02-12) — Anthropic boucle une série G de 30 Md USD menée par GIC et Coatue, qui le valorise à 380 Md USD après l'opération, soit plus du double de sa série F. Son chiffre d'affaires annualisé atteint 14 Md USD.
- MiniMax-M2.5 (2026-02-12) — MiniMax publie M2.5, entraîné par apprentissage par renforcement dans des centaines de milliers d'environnements, avec 80,2 sur SWE-bench Verified et une vitesse de 100 tokens par seconde en version Lightning.
- Qwen3.5 (2026-02-16) — Alibaba lance Qwen3.5, génération multimodale native dont le fleuron à poids ouverts Qwen3.5-397B-A17B (17 milliards de paramètres actifs) sous Apache 2.0, décliné ensuite de 0,8B à 122B.
- Claude Sonnet 4.6 (2026-02-17) — Anthropic lance Claude Sonnet 4.6, son Sonnet le plus capable, amélioré en codage, usage d'ordinateur, raisonnement long contexte et planification d'agents, au même prix que Sonnet 4.5.
- Grok 4.20 (2026-02-17) — xAI lance Grok 4.20 en bêta, un modèle phare orienté vitesse et appels d'outils, avec une architecture multi-agents ; l'accès API et la version finale suivent le 10 mars 2026.
- Lyria 3 (2026-02-18) — Google DeepMind lance Lyria 3, son modèle de génération musicale, en bêta dans l'application Gemini : des pistes de 30 secondes avec paroles générées, à partir d'un texte, d'une photo ou d'une vidéo.
- Sommet AI Impact de New Delhi : la déclaration de New Delhi (2026-02-19) — Le sommet AI Impact, premier sommet mondial sur l'IA organisé dans un pays du Sud, se conclut par la déclaration de New Delhi : un texte non contraignant endossé par 88 pays et organisations, dont les États-Unis et la Chine, puis par 92.
- Gemini 3.1 Pro (2026-02-19) — Google lance Gemini 3.1 Pro en préversion, un modèle de raisonnement qui atteint 77,1 % sur ARC-AGI-2, plus du double de Gemini 3 Pro, disponible via l'API, Vertex AI et l'application Gemini.
- Nouveau terme : claws (2026-02-20) — Les « claws » sont des assistants d'IA personnels et autonomes, sur le modèle d'OpenClaw : ils tournent sur la machine de l'utilisateur, se pilotent par messagerie et planifient des tâches. Andrej Karpathy popularise le terme en février 2026.
- GPT-Realtime-1.5 (2026-02-23) — OpenAI publie GPT-Realtime-1.5 dans l'API Realtime, son modèle audio phare pour les agents vocaux et le support client, avec gpt-audio-1.5 pour l'API Chat Completions.
- Nano Banana 2 (Gemini 3.1 Flash Image) (2026-02-26) — Google DeepMind lance Nano Banana 2 (Gemini 3.1 Flash Image), modèle d'image qui reprend les capacités de Nano Banana Pro à la vitesse de Gemini Flash, du 512 px au 4K.
- GPT-5.3 Instant (2026-03-03) — OpenAI met à jour le modèle le plus utilisé de ChatGPT avec GPT-5.3 Instant : moins de refus inutiles, réponses web mieux synthétisées et hallucinations en baisse.
- Gemini 3.1 Flash-Lite (2026-03-03) — Google lance Gemini 3.1 Flash-Lite, son modèle le plus rapide et le moins cher de la génération 3, à 0,25 USD par million de tokens en entrée, pour la traduction, la classification et le temps réel.
- GPT-5.4 (2026-03-05) — OpenAI lance GPT-5.4, modèle de raisonnement généraliste qui intègre les capacités de code de GPT-5.3-Codex et ajoute l'usage natif d'un ordinateur, avec 1 million de tokens de contexte.
- Le Pentagone désigne Anthropic comme « risque pour la chaîne d'approvisionnement » (2026-03-05) — Après le refus d'Anthropic de laisser Claude servir aux armes entièrement autonomes et à la surveillance de masse des Américains, le Pentagone le déclare officiellement « risque pour la chaîne d'approvisionnement », une première pour une entreprise américaine.
- Olmo Hybrid (7B) (2026-03-05) — Ai2 publie Olmo Hybrid, un modèle entièrement ouvert de 7 milliards de paramètres qui alterne attention et couches Gated DeltaNet, et atteint la précision d'Olmo 3 sur MMLU avec 49 % de tokens en moins.
- Gemini Embedding 2 (2026-03-10) — Google DeepMind lance Gemini Embedding 2, premier modèle d'embedding nativement multimodal, qui place texte, images, vidéo, audio et documents dans un même espace vectoriel, en préversion publique.
- NVIDIA Nemotron 3 Super (120B-A12B) (2026-03-11) — NVIDIA publie Nemotron 3 Super, un modèle ouvert de 120 milliards de paramètres dont 12 milliards actifs, hybride Mamba-Transformer LatentMoE, conçu pour le raisonnement agentique avec un contexte d'un million de tokens.
- GTC 2026 : Nvidia lance la plateforme Vera Rubin (2026-03-16) — À la GTC de San Jose, Jensen Huang présente la plateforme Vera Rubin : sept puces en production, dont le premier LPU issu de Groq, pensées pour l'IA agentique. Il évoque 1 000 Md USD de commandes Blackwell et Vera Rubin d'ici 2027.
- Mistral Small 4 (2026-03-16) — Mistral AI lance Mistral Small 4, un modèle open source Apache 2.0 de 119 milliards de paramètres (6 milliards actifs) qui réunit instruction, raisonnement, vision et agents de code dans un seul modèle.
- Leanstral (2026-03-16) — Mistral AI publie Leanstral, un agent open source Apache 2.0 d'environ 120 milliards de paramètres (6 milliards actifs) pour l'ingénierie de preuves formelles en Lean 4 et le codage vérifiable.
- GPT-5.4 mini et GPT-5.4 nano (2026-03-17) — OpenAI lance GPT-5.4 mini et GPT-5.4 nano, ses petits modèles les plus capables : mini vise le code rapide et les sous-agents, nano la classification et l'extraction à très bas coût.
- MiniMax-M2.7 (2026-03-18) — MiniMax présente M2.7, décrit comme son premier modèle participant à sa propre évolution, avec 56,22 % sur SWE-Pro, 57,0 % sur Terminal Bench 2 et des poids publiés sous licence non commerciale.
- Voxtral TTS (2026-03-23) — Mistral AI lance Voxtral TTS, son premier modèle de synthèse vocale : 4 milliards de paramètres, 9 langues, adaptation de voix en quelques secondes et poids ouverts sous licence CC BY-NC 4.0.
- Lyria 3 Pro (2026-03-25) — Google lance Lyria 3 Pro, sa version la plus avancée de génération musicale : des morceaux jusqu'à 3 minutes avec contrôle de la structure (intro, couplet, refrain, pont), en préversion sur Vertex AI et l'API Gemini.
- Gemini 3.1 Flash Live (2026-03-26) — Google lance Gemini 3.1 Flash Live, son modèle audio et voix le plus abouti, pour agents vocaux en temps réel, via l'API Live, Search Live et Gemini Live, dans plus de 200 pays et territoires.
- OpenAI lève 122 Md USD pour une valorisation de 852 Md USD (2026-03-31) — OpenAI clôt la plus grosse levée de fonds privée de l'histoire : 122 Md USD d'engagements pour une valorisation de 852 Md USD, portés par Amazon, Nvidia et SoftBank, avec pour la première fois 3 Md USD apportés par des particuliers.
- Veo 3.1 Lite (2026-03-31) — Google lance Veo 3.1 Lite, son modèle de génération vidéo le moins cher, à moins de la moitié du prix de Veo 3.1 Fast pour la même vitesse, en paiement à l'usage sur l'API Gemini.
- Gemma 4 (2026-04-02) — Google DeepMind publie Gemma 4, sa famille de modèles ouverts la plus capable, sous licence Apache 2.0, en quatre tailles (E2B, E4B, 26B MoE, 31B dense) conçue pour le raisonnement et les agents.
- Project Glasswing : sécuriser les logiciels critiques avec Claude Mythos Preview (2026-04-07) — Anthropic lance Project Glasswing, un programme de cyberdéfense qui donne à des éditeurs et mainteneurs de logiciels critiques un accès restreint à Claude Mythos Preview. En sept semaines, plus de 10 000 failles graves sont trouvées.
- GLM-5.1 (2026-04-07) — Z.ai a ouvert GLM-5.1 sous licence MIT, modèle phare pour l'ingénierie agentique : 58,4 sur SWE-Bench Pro, et une capacité à rester efficace sur des centaines de tours et des milliers d'appels d'outils.
- Claude Mythos Preview (2026-04-07) — Anthropic annonce Claude Mythos Preview, un modèle de pointe en cybersécurité réservé aux partenaires du Project Glasswing, capable de trouver et d'exploiter des failles logicielles, sans mise à disposition publique.
- Muse Spark (2026-04-08) — Meta Superintelligence Labs présente Muse Spark, son premier modèle multimodal de raisonnement, proposé sur meta.ai et l'application Meta AI sans poids ouverts, en rupture avec la ligne Llama.
- Gemini Robotics-ER 1.6 (2026-04-14) — Google DeepMind publie Gemini Robotics-ER 1.6, modèle de raisonnement incarné amélioré en compréhension spatiale et multi-vues, capable de lire jauges et voyants, disponible via l'API Gemini.
- GPT-5.4-Cyber (2026-04-14) — OpenAI élargit Trusted Access for Cyber à des milliers de défenseurs vérifiés et lance GPT-5.4-Cyber, une variante de GPT-5.4 plus permissive pour la sécurité défensive.
- Qwen3.6 (35B-A3B et 27B) (2026-04-15) — Alibaba publie Qwen3.6 en poids ouverts : Qwen3.6-35B-A3B (MoE) le 15 avril 2026 puis Qwen3.6-27B (dense) le 22 avril, sous Apache 2.0, avec un code agentique qui dépasse celui du fleuron ouvert précédent.
- Gemini 3.1 Flash TTS (2026-04-15) — Google lance Gemini 3.1 Flash TTS en préversion, un modèle de synthèse vocale expressif et pilotable par balises audio, avec dialogue multi-locuteurs et plus de 70 langues.
- Claude Opus 4.7 (2026-04-16) — Anthropic rend Claude Opus 4.7 généralement disponible : un net progrès sur Opus 4.6 en ingénierie logicielle difficile, avec une vision haute résolution et un niveau d'effort xhigh, au même prix.
- GPT-Rosalind (2026-04-17) — OpenAI présente GPT-Rosalind, un modèle de raisonnement spécialisé en biologie, découverte de médicaments et médecine translationnelle, proposé en aperçu de recherche par accès de confiance.
- Kimi K2.6 (2026-04-20) — Moonshot AI publie Kimi K2.6, modèle ouvert multimodal de 1000 milliards de paramètres axé sur le codage de longue durée et un essaim pouvant coordonner 300 sous-agents sur 4000 étapes.
- GPT Image 2 (ChatGPT Images 2.0) (2026-04-21) — OpenAI lance ChatGPT Images 2.0 et le modèle gpt-image-2 : premier modèle d'image OpenAI avec raisonnement, sorties jusqu'à 2K et meilleur rendu des textes non latins.
- OpenAI Privacy Filter (2026-04-22) — OpenAI publie Privacy Filter, un petit modèle open-weight sous licence Apache 2.0 qui détecte et masque les données personnelles dans un texte, exécutable en local.
- GPT-5.5 (2026-04-23) — OpenAI lance GPT-5.5, son modèle le plus capable de l'époque pour le code, la recherche, l'usage d'ordinateur et les documents, avec une latence par token identique à GPT-5.4.
- Grok Voice Think Fast 1.0 (2026-04-23) — xAI lance Grok Voice Think Fast 1.0, son modèle vocal phare pour agents de support et de vente, capable de raisonner en arrière-plan sans latence ajoutée et classé premier du tau-voice Bench.
- DeepSeek V4 Pro et V4 Flash (2026-04-24) — DeepSeek publie en préversion V4-Pro (1,6 billion de paramètres, 49 milliards actifs) et V4-Flash (284 milliards, 13 milliards actifs), tous deux avec un contexte d'un million de tokens, sous licence MIT.
- MiMo-V2.5-Pro (2026-04-27) — Xiaomi ouvre MiMo-V2.5-Pro, un MoE de 1,02 billion de paramètres dont 42 milliards actifs, avec un contexte d'un million de tokens, sous licence MIT, visant les tâches d'agents et de génie logiciel de longue durée.
- NVIDIA Nemotron 3 Nano Omni (30B-A3B) (2026-04-28) — NVIDIA lance Nemotron 3 Nano Omni, un modèle ouvert de 30 milliards de paramètres dont environ 3 milliards actifs, qui unifie vision, audio et langage pour des agents, avec un débit annoncé 9 fois supérieur.
- Grok 4.3 (2026-04-30) — xAI déploie Grok 4.3, un modèle à raisonnement intégré avec 1 M de tokens de contexte, à un tarif fortement réduit (1,25 USD en entrée, 2,50 USD en sortie par million de tokens).
- GPT-5.5 Instant (2026-05-05) — OpenAI remplace GPT-5.3 Instant par GPT-5.5 Instant comme modèle par défaut de ChatGPT, avec 52,5 % d'affirmations hallucinées en moins sur les sujets à enjeux.
- GPT-5.5-Cyber (2026-05-07) — OpenAI déploie GPT-5.5-Cyber en aperçu limité pour les défenseurs d'infrastructures critiques, une variante permissive de GPT-5.5 pour les tests d'intrusion et la validation d'exploits autorisés.
- GPT-Realtime-2 (2026-05-07) — OpenAI lance trois modèles audio dans l'API Realtime : GPT-Realtime-2 pour les agents vocaux avec raisonnement, GPT-Realtime-Translate pour la traduction en direct et GPT-Realtime-Whisper pour la transcription.
- Gemini 3.5 Flash (2026-05-19) — Google présente la famille Gemini 3.5 à I/O avec 3.5 Flash, son modèle le plus fort en agents et code, disponible immédiatement, en tête de Gemini 3.1 Pro sur Terminal-Bench 2.1 et MCP Atlas.
- Gemini Omni Flash (2026-05-19) — Google présente Gemini Omni à I/O, un modèle qui crée à partir de n'importe quelle entrée, à commencer par la vidéo : Gemini Omni Flash génère et édite des vidéos par conversation, avec raisonnement sur le monde réel.
- Mistral Medium 3.5 (2026-05-22) — Mistral AI présente Mistral Medium 3.5, son premier modèle phare fusionné : 128 milliards de paramètres denses, contexte de 256k, instruction, raisonnement, code et vision, en poids ouverts sous licence MIT modifiée.
- Claude Opus 4.8 (2026-05-28) — Anthropic lance Claude Opus 4.8, qui prolonge Opus 4.7 avec de meilleurs résultats et un comportement plus honnête en tâches agentiques, au même prix, avec 1 M de tokens de contexte par défaut.
- Anthropic lève 65 Md USD pour une valorisation de 965 Md USD (2026-05-28) — Anthropic lève 65 Md USD en série H, menée par Altimeter, Dragoneer, Greenoaks et Sequoia, pour une valorisation de 965 Md USD : l'entreprise dépasse OpenAI pour la première fois. Son chiffre d'affaires annualisé franchit 47 Md USD.
- Step 3.7 Flash (2026-05-29) — StepFun publie Step 3.7 Flash, un modèle vision-langage à experts de 198 milliards de paramètres dont 11 milliards actifs, sous Apache 2.0, avec 256 000 tokens de contexte et jusqu'à 400 tokens par seconde.
- Grok Build 0.1 (2026-05-29) — xAI ouvre en bêta publique via l'API grok-build-0.1, le modèle de code agentique qui alimente son CLI Grok Build, à 1 USD en entrée et 2 USD en sortie par million de tokens.
- MiniMax-M3 (2026-06-01) — MiniMax publie M3, un MoE multimodal d'environ 428 milliards de paramètres (23 milliards actifs) avec un million de tokens de contexte grâce à une attention parcimonieuse, et des poids sous licence communautaire.
- Grok Imagine Video 1.5 (2026-06-03) — xAI propose en préversion API grok-imagine-video-1.5-preview, qui anime une image en vidéo cinématographique par instructions en langage naturel ; la disponibilité générale suit à la mi-juin.
- Gemma 4 12B (2026-06-03) — Google DeepMind ajoute Gemma 4 12B à la famille Gemma 4 : un modèle ouvert de taille intermédiaire, sans encodeurs séparés pour la vision et l'audio, qui tourne sur un laptop de 16 Go.
- NVIDIA Nemotron 3 Ultra (550B-A55B) (2026-06-04) — NVIDIA publie Nemotron 3 Ultra, un MoE de 550 milliards de paramètres dont 55 milliards actifs pour les agents de longue durée, avec poids, données et recettes sous licence OpenMDW-1.1.
- Nouveau terme : harness auto-améliorant (2026-06-08) — Un harness auto-améliorant (self-improving harness) est un harness d'agent que l'agent modifie lui-même : il analyse ses échecs, propose des changements et ne les garde qu'après tests de non-régression. L'article « Self-Harness » formalise l'idée en juin 2026.
- Claude Fable 5 et Claude Mythos 5 (2026-06-09) — Anthropic lance Claude Fable 5, un modèle de classe Mythos rendu sûr pour un usage général, et Claude Mythos 5, même modèle aux garde-fous allégés, réservé à la cyberdéfense et à la recherche en biologie.
- Gemini 3.5 Live Translate (2026-06-09) — Google lance Gemini 3.5 Live Translate, modèle de traduction vocale quasi temps réel de parole à parole, avec détection automatique de plus de 70 langues et conservation de l'intonation du locuteur.
- DiffusionGemma (2026-06-10) — Google DeepMind publie DiffusionGemma, un modèle ouvert expérimental de 26B (3,8B actifs) qui génère le texte par diffusion, jusqu'à quatre fois plus vite qu'un modèle autorégressif sur GPU dédié.
- Introduction en bourse de SpaceX, xAI compris : la plus importante de l'histoire (2026-06-12) — SpaceX, qui a absorbé xAI en février, entre au Nasdaq (SPCX) après avoir levé 75 Md USD à 135 USD par action, la plus grosse introduction en bourse de l'histoire. L'action gagne 19 % le premier jour et la valorisation dépasse 2 000 Md USD.
- Kimi K2.7 Code (2026-06-12) — Moonshot AI publie Kimi K2.7 Code, un modèle ouvert spécialisé codage dérivé de K2.6, qui réduit d'environ 30 % les tokens de réflexion tout en améliorant les tâches d'ingénierie logicielle de longue durée.
- GLM-5.2 (2026-06-16) — Z.ai a publié GLM-5.2 sous licence MIT : un contexte de 1M tokens présenté comme solide, l'architecture IndexShare, des niveaux d'effort High et Max, et 81,0 sur Terminal-Bench 2.1 (Terminus-2).
- Mistral OCR 4 (2026-06-23) — Mistral AI lance Mistral OCR 4, son modèle de reconnaissance documentaire : 170 langues, coordonnées et types de blocs, scores de confiance, avec option d'auto-hébergement pour les entreprises.
- LongCat-2.0 (2026-06-29) — Meituan annonce LongCat-2.0, un modèle à experts de 1,6 billion de paramètres dont environ 48 milliards actifs, sous licence MIT, avec un million de tokens de contexte, entraîné sur des ASIC chinois.
- Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) (2026-06-30) — Google lance Nano Banana 2 Lite, son modèle d'image Gemini le plus rapide et le moins cher : environ 4 secondes par image et 0,034 USD pour une image 1K, pour les flux à fort volume.
- Claude Sonnet 5 (2026-06-30) — Anthropic lance Claude Sonnet 5, son Sonnet le plus agentique : planification, usage de navigateurs et de terminaux, exécution autonome à un niveau qui demandait récemment des modèles plus grands et plus chers.
- Leanstral 1.5 (2026-07-02) — Mistral AI publie Leanstral 1.5, agent open source Apache 2.0 de 119 milliards de paramètres (6 milliards actifs) pour les preuves Lean 4, qui sature miniF2F et résout 587 problèmes PutnamBench sur 672.
- Hy3 (2026-07-06) — Tencent publie Hy3, un modèle à experts de 295 milliards de paramètres dont 21 milliards actifs, sous licence Apache 2.0, avec 256 000 tokens de contexte, conçu pour les agents et les usages de production.
- GPT-Realtime-2.1 (2026-07-06) — OpenAI publie GPT-Realtime-2.1, une mise à jour de son modèle vocal avec raisonnement, et GPT-Realtime-2.1 mini, une version distillée plus rapide et moins chère.
- Grok 4.5 (2026-07-08) — SpaceXAI présente Grok 4.5, modèle pour le code, les agents et le travail de connaissance, entraîné avec Cursor et facturé 2 USD en entrée et 6 USD en sortie par million de tokens.
- Robostral Navigate (2026-07-08) — Mistral AI présente Robostral Navigate, son premier modèle de navigation embarquée : 8 milliards de paramètres, une seule caméra RGB, entraîné en simulation, pour guider des robots à partir d'instructions en langage naturel.
- GPT-Live (GPT-Live-1 et GPT-Live-1 mini) (2026-07-08) — OpenAI lance GPT-Live, une nouvelle génération de modèles vocaux full-duplex qui écoutent et parlent en même temps, avec GPT-Live-1 et GPT-Live-1 mini qui alimentent ChatGPT Voice.
- GPT-5.6 (Sol, Terra et Luna) (2026-07-09) — OpenAI lance la famille GPT-5.6 : Sol (modèle phare), Terra (équilibre coût et intelligence) et Luna (le plus économique), avec un nouveau mode d'effort max et un mode ultra multi-agents.
- Muse Spark 1.1 et Meta Model API (2026-07-09) — Meta lance Muse Spark 1.1 dans son Meta Model API en aperçu public : modèle multimodal de raisonnement à contexte d'un million de tokens, orienté agents, outils et code.
- Kimi K3 (2026-07-16) — Moonshot AI lance Kimi K3, un MoE de 2,8 billions de paramètres (104 milliards actifs) à contexte d'un million de tokens, présenté comme le premier modèle ouvert de classe 3T, avec poids publiés le 27 juillet 2026.
- Gemini 3.5 Flash-Lite (2026-07-21) — Google lance Gemini 3.5 Flash-Lite, son modèle le plus rapide et économique de la série 3.5, à environ 350 tokens par seconde, pour la recherche agentique, le traitement de documents et les flux à haut débit.
- Gemini 3.6 Flash (2026-07-21) — Google lance Gemini 3.6 Flash, un modèle de travail plus efficace en tokens que 3.5 Flash, moins cher en sortie et meilleur en code, connaissance métier et usage d'ordinateur, avec 3.5 Flash-Lite et 3.5 Flash Cyber.
- Claude Opus 5 (2026-07-24) — Anthropic lance Claude Opus 5, modèle réfléchi et proactif proche de l'intelligence de Claude Fable 5 pour la moitié du prix, au même tarif qu'Opus 4.8.
- Entrée en vigueur de l'Omnibus numérique sur l'IA : obligations à haut risque reportées (2026-07-27) — Le règlement (UE) 2026/1744, dit Omnibus numérique sur l'IA, entre en vigueur : première modification de l'AI Act, il reporte les obligations des systèmes à haut risque au 2 décembre 2027 et au 2 août 2028, sans toucher aux règles des modèles d'usage général.
- GPT Transcribe et GPT Live Transcribe (2026-07-28) — OpenAI publie GPT Transcribe pour la transcription de fichiers et GPT Live Transcribe pour la transcription en flux à faible latence, avec indices de mots-clés et de langues.
- Grok Voice Think Fast 2.0 (2026-07-29) — SpaceXAI lance Grok Voice Think Fast 2.0, modèle vocal parole à parole plus intelligent, avec un premier son en 0,70 seconde et un tarif de 0,08 USD par minute d'audio.
- Lyria 3.5 (2026-07-29) — Google lance Lyria 3.5, nouvelle version de son modèle de génération musicale, avec une meilleure musicalité, des paroles plus fidèles au prompt et des voix plus expressives, d'abord dans Flow Music.
- Gemini Robotics ER 2 (2026-07-30) — Google DeepMind lance Gemini Robotics ER 2, son modèle de raisonnement incarné le plus capable, qui suit l'avancement des tâches en vidéo continue et orchestre plusieurs robots via l'API Live.
- Shieldstral (2026-08-04) — Mistral AI lance Shieldstral 1.0, un classifieur de sécurité multimodal de 3 milliards de paramètres sous licence Apache 2.0, qui applique des politiques rédigées en langage naturel sans réentraînement.
- Muse Spark 1.2 et Muse Code (2026-08-05) — Meta lance Muse Code, un agent de codage en terminal, avec Muse Spark 1.2, disponibles dans le Meta Model API avec deux paliers tarifaires selon l'usage des données pour l'entraînement.
- GPT-5.6-Cyber (2026-08-10) — OpenAI lance GPT-5.6-Cyber, modèle spécialisé construit sur GPT-5.6 Sol, et ouvre deux paliers d'accès Daybreak : Blue pour la défense courante, Red pour l'exploitation et la recherche avancée.
- Muse Glimmer 30B (2026-08-10) — Meta publie Muse Glimmer, un modèle dense de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0, distillé de Muse Spark et conçu pour des agents locaux sur un PC ou un Mac avec un seul GPU.
- NVIDIA Nemotron 3.5 Lightning (30B-A3B) (2026-08-11) — NVIDIA publie Nemotron 3.5 Lightning, un MoE ouvert de 30 milliards de paramètres dont 3 milliards actifs, pensé pour l'exécution rapide d'agents et pour être spécialisé par post-entraînement, sous licence OpenMDW-1.1.
- Grok 4.6 (2026-08-12) — SpaceXAI lance Grok 4.6, modèle pour agents de longue durée et travaux visuels ou interactifs, à 2 USD en entrée et 6 USD en sortie par million de tokens, avec 500k tokens de contexte.
- Qwen3.8-27B (2026-08-13) — Alibaba publie Qwen3.8-27B, modèle dense multimodal de 27 milliards de paramètres sous licence Apache 2.0, qui dépasse sur plusieurs tests agentiques la version fermée Qwen3.7-Plus selon les chiffres de l'éditeur.
- Qwen3.8-Max (poids ouverts : Qwen3.8-2.4T-A95B) (2026-08-13) — Alibaba a lancé Qwen3.8-Max par API le 3 août 2026 puis publié ses poids (Qwen3.8-2.4T-A95B, 95 milliards de paramètres actifs) sous licence maison, une première pour un modèle de classe Max.
- DeepSeek V4 Pro (version finale) (2026-08-13) — DeepSeek publie la version finale de V4-Pro (V4-Pro-0813), avec des capacités d'agent nettement renforcées, trois niveaux d'effort de réflexion et une grille tarifaire avec tarifs de pointe et hors pointe.
- Gemini 3.7 Flash (2026-08-13) — Google lance Gemini 3.7 Flash, son modèle de travail le plus intelligent pour le code et les agents, trois semaines après 3.6 Flash, avec un prix d'introduction de moitié inférieur.
- GLM-5.3 (2026-08-14) — Z.ai a lancé GLM-5.3 le 14 août 2026, même base que GLM-5.2 mais post-entraînement renforcé : meilleur code long, cybersécurité (CyberGym 84,5). Poids ouverts le 25 août, sous une licence GLM-5.3 propre, non MIT.
- Qwen3.8-Flash-Next (2026-08-26) — Alibaba publie Qwen3.8-Flash-Next, modèle multimodal à poids ouverts de 125 milliards de paramètres dont 6 milliards actifs, présenté comme la préversion expérimentale de l'architecture de la future génération Qwen4.
- Gemini 3.5 Transcribe (2026-08-26) — Google lance Gemini 3.5 Transcribe, son modèle de reconnaissance vocale le plus précis, qui transforme l'audio en texte propre et formaté, en streaming (Live API) ou sur fichiers enregistrés.
- GLM-5.3-Flash (et GLM-5.3-FlashX) (2026-08-26) — Z.ai a publié GLM-5.3-Flash, MoE multimodal natif de 320B paramètres (18B actifs) à attention hybride et contexte 1M, sous licence MIT, facturé 0,15 USD en entrée et 0,50 USD en sortie par million de tokens.
- Gemini Omni 1.1 Flash (2026-08-27) — Google lance Gemini Omni 1.1 Flash, version prête pour la production de son modèle vidéo, avec extension de scène, images de début et de fin, brouillons en 360p et montée en 4K.
- Claude Fable 5.1 et Claude Mythos 5.1 (2026-09-01) — Anthropic lance Claude Fable 5.1 et Claude Mythos 5.1, présentés comme ses modèles les plus avancés en codage et travail de connaissance, moins coûteux que Fable 5 et avec des garde-fous plus précis.
- Gemini 3.8 Flash (2026-09-02) — Google lance Gemini 3.8 Flash, son modèle Flash le plus intelligent, meilleur en code, agents et raisonnement multi-étapes au même prix que 3.7 Flash, avec la variante cybersécurité 3.8 Flash Cyber.
- Muse Spark 1.3 (2026-09-02) — Meta publie Muse Spark 1.3, son modèle propriétaire le plus avancé, disponible dans Muse Code et le Meta Model API, avec des gains en tâches agentiques et un usage réduit d'outils et de tokens.
- GPT-6 Astra (2026-09-03) — OpenAI lance GPT-6 Astra, présenté comme son modèle le plus intelligent et le mieux aligné, avec de nouveaux sommets en usage d'ordinateur, navigation, génie logiciel et cybersécurité.
- GPT Image 2.5 (Sunburst et Flare) (2026-09-08) — OpenAI lance ChatGPT Images 2.5 et deux modèles d'API : GPT-Image-2.5 Flare, rapide pour l'usage courant, et GPT-Image-2.5 Sunburst, plus précis pour l'édition détaillée.
- Mistral lève 3 Md€, plus grosse levée d'une entreprise technologique européenne (2026-09-08) — Mistral AI boucle une série D de 3 Md€ menée par Samsung Electronics, pour une valorisation de plus de 21 Md€ : la plus grosse levée en capital jamais réalisée par une entreprise technologique européenne, au service d'une IA souveraine à poids ouverts.
- GPT-Live-1 (API) (2026-09-10) — OpenAI ouvre GPT-Live-1 dans l'API : un modèle vocal full-duplex qui écoute et parle en même temps, tarifé 0,05 $ la minute, avec délégation du raisonnement à un modèle texte.
- DeepSeek V4.1 Flash (2026-09-10) — DeepSeek publie V4.1-Flash, un MoE multimodal de 552 milliards de paramètres à architecture encodeur-décodeur causale, avec 8 milliards de paramètres actifs en lecture, 16 en génération, sous licence MIT.
- Gemini 3.8 Live et 3.8 Live Extended Thinking (2026-09-15) — Google lance Gemini 3.8 Live et 3.8 Live Extended Thinking, deux modèles de dialogue vocal quasi temps réel, le second raisonnant tout en parlant, pour agents vocaux, Search Live, Gemini Live et Workspace.
- Jev (2026-09-15) — TypeSafe AI, start-up de San Francisco, lance Jev en accès anticipé limité : un modèle « System One » qui renvoie des décisions typées avec probabilités plutôt que du texte.
- Grok Voice Transcribe 2.0 (2026-09-18) — SpaceXAI publie Grok Voice Transcribe 2.0, modèle de transcription deux fois plus précis, multilingue, avec horodatage par mot, séparation des locuteurs et multicanal, au tarif existant.
- Grok 4.7 (2026-09-21) — SpaceXAI lance Grok 4.7, son modèle le plus capable pour le code et le travail de connaissance, sur base plus large que Grok 4.6, au même tarif de 2 USD en entrée et 6 USD en sortie.
- GPT-6 Sol et GPT-6 Luna (2026-09-22) — OpenAI élargit la famille GPT-6 avec Sol et Luna, entraînés avec les mêmes méthodes qu'Astra mais moins chers : les prix API baissent de 50 % par rapport aux tarifs promotionnels de GPT-5.6.
- Claude Opus 5.5 (2026-09-22) — Anthropic lance Claude Opus 5.5, premier modèle de la famille Claude 5.5, au niveau de Fable 5.1 sur la plupart des tâches pour un coût inférieur de 40 % à celui d'Opus 5.
- Gemini 3.8 Flash TTS et 3.8 Flash-Lite TTS (2026-09-23) — Google lance Gemini 3.8 Flash TTS et 3.8 Flash-Lite TTS, deux modèles de synthèse vocale avec création de voix par prompt, réplication de voix à partir de 30 secondes d'audio et bibliothèque de plus de 2 000 voix.
- Claude Sonnet 5.5 (2026-09-28) — Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille 5.5 : plus de 30 % plus rapide que Sonnet 5 et jusqu'à 30 % moins cher pour la plupart des tâches, au même prix par token.