Codestral Embed
2025-05-28 · Éditeur : Mistral AI · Domaine : Intelligence Artificielle
Mistral AI lance Codestral Embed, son premier modèle d'embedding spécialisé dans le code, annoncé au-dessus de Voyage Code 3, Cohere Embed v4.0 et du grand modèle d'embedding d'OpenAI pour la recherche de code.
Ce qui change
- Premier modèle d'embedding de Mistral dédié au code, pensé pour la récupération sur des dépôts réels.
- Dimensions et précisions configurables (ex. 256 dimensions en int8) ; les dimensions sont ordonnées par pertinence, on peut tronquer aux n premières.
- Même en 256 dimensions int8, annoncé au-dessus des modèles concurrents.
- Usages : RAG pour assistants de code, recherche sémantique, détection de doublons, clustering.
Mistral AI lance Codestral Embed, son premier modèle d'embedding spécialisé dans le code, annoncé au-dessus de Voyage Code 3, Cohere Embed v4.0 et du grand modèle d'embedding d'OpenAI pour la recherche de code. ### Ce qui change - Premier modèle d'embedding de Mistral dédié au code, pensé pour la récupération sur des dépôts réels. - Dimensions et précisions configurables (ex. 256 dimensions en int8) ; les dimensions sont ordonnées par pertinence, on peut tronquer aux n premières. - Même en 256 dimensions int8, annoncé au-dessus des modèles concurrents. - Usages : RAG pour assistants de code, recherche sémantique, détection de doublons, clustering. ### Caractéristiques - Contexte : 8192 tokens ; découpage recommandé en blocs de 3000 caractères avec 1000 de recouvrement. - Licence : propriétaire (modèle Premier) ; déploiement sur site sur demande. - Disponibilité : API La Plateforme et API batch. - Identifiant API : `codestral-embed-2505`. ### Tarifs | Modèle | Prix (USD / M tokens) | |---|---| | Codestral Embed | 0,15 | | Batch API | remise de 50 % | ### Benchmarks Les graphiques du billet sont des images ; aucun score chiffré en texte. Catégories évaluées : SWE-Bench Lite (récupération de fichiers), Text2Code (GitHub), Text2SQL, algorithmes, data science. ### À retenir Un embedding spécialisé pour indexer de grandes bases de code, avec un réglage fin du compromis qualité et coût de stockage.
Liens
Tags : LLM, Mistral, Embedding, Code, RAG