Modèles de décision ouverts : Cloudflare Clef et Amazon Strands Decider
2026-10-01 · Éditeur : Cloudflare, Amazon · Domaine : Intelligence Artificielle
Cloudflare publie Clef (27 B) et Clef-flash (9 B), et Amazon Strands Labs Strands Decider (2 B), tous sous Apache 2.0. Ces modèles ne génèrent pas de texte : ils renvoient des réponses typées avec leurs probabilités.
Ce qui change
- Clef (27 milliards de paramètres) et Clef-flash (9 milliards) : modèles de décision hébergés sur Workers AI, poids sur Hugging Face, contexte de 64 k tokens.
- Facturation à l'entrée seulement : 0,24 $ le million de tokens pour Clef, 0,09 $ pour Clef-flash.
- Strands Decider 2B, d'Amazon Strands Labs : 2 milliards de paramètres, exécutable en local sur CPU ou GPU, environ 72 % sur JevBench v19, latence médiane de 106 ms sur une RTX 3090.
- Principe commun : on envoie un état et des questions typées (oui/non, choix, échelle) et le modèle renvoie une probabilité par réponse possible, sans texte généré.
- Les deux publications visent Jev, un modèle de décision commercial ; Clef est compatible avec son API, et les deux sont parues le même jour.
### Contexte Un modèle de décision ne rédige pas de réponse : il reçoit un état et un schéma de questions typées, puis renvoie en un seul passage une probabilité pour chaque réponse autorisée. Pour un agent qui doit seulement router, classer ou trancher, cela évite de payer la génération de texte, ce que ces annonces mettent en avant. Cloudflare et Amazon Strands Labs ont publié leurs modèles le 1er octobre 2026, face à Jev, un modèle de décision commercial dont l'API sert de référence. ### Caractéristiques | Modèle | Éditeur | Paramètres | Contexte | Licence | Exécution | | --- | --- | --- | --- | --- | --- | | Clef | Cloudflare | 27 milliards | 64 k tokens | Apache 2.0 | Workers AI ; poids sur Hugging Face | | Clef-flash | Cloudflare | 9 milliards | 64 k tokens | Apache 2.0 | Workers AI ; poids sur Hugging Face | | Strands Decider 2B | Amazon Strands Labs | 2 milliards | non précisé | Apache 2.0 | Local (CPU ou GPU) ; poids sur Hugging Face | - **Clef** : API à trois types de questions (booléen, choix nommés, valeurs ordonnées), jusqu'à 64 questions par requête, encodeur de vision pour classer des images. Latence médiane publiée : 209,3 ms pour Clef, 38,8 ms pour Clef-flash (95e centile : 238,6 ms et 122,4 ms). - **Strands Decider 2B** : construit sur Qwen3.5-2B, dont la tête de génération de texte est remplacée par une « tête pointeur » d'environ un million de paramètres qui note les options fournies. Latence médiane de 106 ms (95e centile 296 ms) sur une RTX 3090, d'après la presse spécialisée ; la page de Strands cite environ 115 ms. - **Cloudflare** propose en outre une offre de réglage fin par apprentissage par renforcement, d'abord via ses ingénieurs, avec un libre-service annoncé. ### Tarifs | Poste | Tarif (USD par million de tokens) | | --- | --- | | Clef, entrée | 0,24 | | Clef-flash, entrée | 0,09 | | Sortie (Clef et Clef-flash) | non facturée | | Strands Decider 2B | gratuit, hébergement à votre charge | ### Benchmarks Scores publiés par les éditeurs. | Modèle | Évaluation | Résultat | | --- | --- | --- | | Strands Decider 2B | JevBench v19 (jeu public) | environ 72 %, 3e sur 33 dans la classe 2 B | | Clef | Jev Decision Index | en tête selon Cloudflare ; score chiffré non relevé | ### À retenir Les modèles de décision visent la couche « système 1 » des agents : des choix rapides et peu coûteux, laissant les modèles de langage à la génération. Les scores restent publiés par les éditeurs sur des évaluations liées à Jev ; une mesure indépendante sur vos propres cas d'usage reste nécessaire.
Liens
Tags : Modèles de décision, Cloudflare, Amazon, Strands, Open Source, Apache 2.0, Agents