Claude 3.5 Sonnet

2024-06-20 · Éditeur : Anthropic · Domaine : Intelligence Artificielle

Anthropic lance Claude 3.5 Sonnet, premier modèle de la famille 3.5 : il dépasse Claude 3 Opus sur la plupart des évaluations, 2 fois plus vite et 5 fois moins cher, et inaugure les « Artifacts » dans Claude.ai.

Ce qui change

  • Un modèle de milieu de gamme qui dépasse Claude 3 Opus, le haut de gamme d'alors, sur les évaluations de raisonnement, de code et de vision.
  • 2 fois plus rapide que Claude 3 Opus et 5 fois moins cher : 3 USD en entrée et 15 USD en sortie par million de tokens, contre 15 et 75.
  • Évaluation interne de programmation agentique : 64 % de problèmes résolus, contre 38 % pour Claude 3 Opus.
  • Nouveaux records annoncés en GPQA (59,4 %), MMLU (88,7 % en 5-shot) et HumanEval (92,0 %), selon les scores publiés par l'éditeur.
  • Les « Artifacts » affichent code, documents et visuels générés dans une fenêtre dédiée, à côté de la conversation.

Anthropic lance Claude 3.5 Sonnet, premier modèle de la génération Claude 3.5. Positionné en milieu de gamme, il dépasse pourtant Claude 3 Opus, le modèle le plus puissant de l'éditeur jusqu'alors, tout en étant plus rapide et bien moins cher. ### Ce qui change - Meilleur que Claude 3 Opus sur l'ensemble des évaluations publiées de raisonnement, de mathématiques, de code et de compréhension de texte. - 2 fois plus rapide que Claude 3 Opus, au prix du milieu de gamme : 5 fois moins cher. - Programmation agentique : 64 % des problèmes résolus sur une évaluation interne (corriger un bogue ou ajouter une fonctionnalité dans une base de code open source), contre 38 % pour Claude 3 Opus. - Vision : meilleur modèle Claude sur les graphiques, les diagrammes et la transcription de texte dans des images imparfaites. - Les « Artifacts » dans Claude.ai : le code, les documents et les visuels générés s'affichent dans une fenêtre dédiée, modifiable au fil de la conversation. ### Caractéristiques - Contexte de 200 000 tokens. - Disponible dans Claude.ai (y compris en gratuit), l'application iOS, l'API Anthropic, Amazon Bedrock et Google Cloud Vertex AI. - Classé ASL-2 ; évalué avant lancement par l'AI Safety Institute britannique. ### Tarifs au lancement | Modèle (USD par million de tokens) | Entrée | Sortie | | --- | --- | --- | | Claude 3.5 Sonnet | 3 | 15 | | Claude 3 Opus (pour comparaison) | 15 | 75 | ### Benchmarks publiés par l'éditeur Scores publiés par l'éditeur (addendum à la fiche modèle Claude 3). | Benchmark | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | | --- | --- | --- | --- | | GPQA Diamond (0-shot CoT) | 59,4 % | 50,4 % | 53,6 % | | MMLU (5-shot) | 88,7 % | 86,8 % | non communiqué | | HumanEval | 92,0 % | 84,9 % | 90,2 % | | MATH (0-shot CoT) | 71,1 % | 60,1 % | 76,6 % | | MMMU (vision) | 68,3 % | 59,4 % | 69,1 % | | Programmation agentique (interne) | 64 % | 38 % | non communiqué | ### Pourquoi c'est un tournant Le modèle intermédiaire de la nouvelle génération dépasse le haut de gamme de la précédente, pour un cinquième de son prix. Claude 3.5 Sonnet devient une référence pour le développement logiciel assisté, et les « Artifacts » transforment la conversation en espace de travail. ### À retenir Un modèle plus capable, plus rapide et moins cher que le précédent haut de gamme, qui installe durablement Anthropic sur le terrain du code.

Liens

Tags : LLM, Anthropic, Claude, Artifacts, Claude 3.5, Code, Multimodal