Strands Decider 2B : Amazon publie son clone open source de Jev, deux jours après OpenAI
Deux jours après la Decisions API d'OpenAI, AWS publie Strands Decider 2B en open source : la catégorie née avec Jev s'installe chez les géants.

Le feuilleton des modèles de décision vit une semaine éclair. Jeudi 1er octobre, AWS a publié Strands Decider 2B, un modèle de décision open source inspiré de Jev, lancé quinze jours plus tôt par la start-up TypeSafe AI. L'annonce tombe deux jours après la Decisions API annoncée en aparté par Sam Altman au DevDay : ce qui était le produit d'une jeune pousse devient une catégorie qu'Amazon embrasse, code et données d'entraînement compris.
L'origine est singulière, racontée par TechCrunch (Tim Fernholz, 1er octobre) : un projet personnel de Marc Brooker, « distinguished engineer » chez Amazon, séduit par Jev et qui a construit sa propre version. Son brouillon a brièvement occupé la première place de JevBench pour sa taille, avant qu'Amazon ne le reprenne et ne le publie via Strands Labs, son organisation d'outils pour agents.
Un modèle qui choisit, et dit à quel point il est sûr
Strands Decider 2B ne parle pas, il tranche. Le développeur soumet un état et des questions à options fermées : quelle équipe traiter ce message, ce texte est-il urgent. Le modèle répond par un choix assorti d'un score de confiance calibré, en trois types de questions (oui ou non, choix parmi N, notation sur échelle). Le billet d'AWS assume le compromis : plus rapide et plus fiable qu'un LLM à taille égale, mais incapable de raisonner longtemps, de coder ou de rédiger.
L'architecture, décrite dans le dépôt, est celle d'un LLM amputé : le torse préentraîné de Qwen3.5-2B-Base (voir notre fiche Qwen) est conservé, mais sa tête de génération est retirée, donc son aptitude à écrire. À la place, une « tête pointeur » d'un peu plus d'un million de paramètres note chaque option en une seule passe, sans boucle de décodage. Le modèle tourne sur CPU comme sur GPU grand public, avec les latences ci-dessous.

Publié sous Apache 2.0, le dépôt va plus loin que la plupart des poids ouverts : scripts d'entraînement, sources des données et journal de recherche inclus, chaque expérience déclarant ses prédictions avant l'entraînement depuis la v9. La version publiée est la v19, la v20 n'ayant pas battu son prédécesseur au-delà du bruit statistique. Au 2 octobre, le dépôt affiche 134 étoiles, les poids sont sur Hugging Face.
Ce que valent les clones sur JevBench
Le modèle se mesure sur JevBench, le classement indépendant publié par Benchmark Heaven. Sur la version v1.4.2 du 25 septembre (89 systèmes classés), la v19 réussit 167 des 231 tâches publiques (0,723), 50e au général. AWS cite surtout sa taille : « 3e sur 33 en classe 2B, et 1er sur 30 en excluant les modèles dépassant à peine 2 milliards de paramètres » (traduit de l'anglais). La « première place pour sa taille » relatée par TechCrunch tient donc au périmètre retenu.
La concurrence est dense, toujours d'après le relevé du dépôt : decision-2b de FlyMy.AI à 0,753, system-one-open à 0,732, decider-2b de Mapika à 0,710 sur le même torse Qwen (sa sortie la plus récente ferait mieux, huit tâches devant la v19). En haut du tableau, les modèles de raisonnement (GPT-6 Luna à 0,996) et les reconstructions de Jev sur des torses de 12 milliards et plus restent hors de portée. Le dépôt prévient lui-même : une différence inférieure à dix tâches reste non concluante.
| Modèle | Éditeur | Statut | Ce qu'il fait |
|---|---|---|---|
| Jev | TypeSafe AI | API en accès anticipé (15 septembre) | Le modèle originel : décisions typées, 0,042 $ par million de tokens d'entrée |
| Decisions API | OpenAI | Aperçu limité (annoncée le 29 septembre) | Luna choisit entre options prédéfinies, sans test indépendant publié |
| Strands Decider 2B | AWS (Strands Labs) | Open source Apache 2.0 (1er octobre) | Choisit et rend un score de confiance, s'exécute en local |
La version v1.5.5 de JevBench, consultée le 2 octobre, a changé de méthodologie (1 624 décisions par système, dont 720 scellées, 109 systèmes classés) et ne liste plus Strands Decider dans ses entrées nommées. Les chiffres d'AWS portent tous sur la v1.4.2 du 25 septembre : à dater comme tels.
Pourquoi un géant copie une start-up en quinze jours
Chez AWS, le besoin est venu des clients. Marc Brooker explique à TechCrunch que les flux agents de certains clients n'exigeaient pas toujours la capacité, ni le coût, d'un LLM complet : « Ce qui a d'abord éveillé mon intérêt pour cette classe de modèles, c'est qu'ils font un décideur parfait pour une étape de flux de travail : quelle est la prochaine chose à faire ici, selon où j'en suis ? » (traduit de l'anglais). L'équilibre à trouver : pousser précision et calibrage sans dégrader la compréhension des langues ni les connaissances générales.
Le coût de développement, estimé par Brooker à quelques centaines ou milliers de dollars pour cette taille de modèle selon TechCrunch, se lit dans la recette : onze heures sur une carte grand public suffisent à tout réentraîner. Le même ingénieur n'attend pas des laboratoires frontière qu'ils dominent ce créneau, aux marchés plus petits.
Strands Decider 2B, un petit modèle de décision open source, parfait pour l'expérimentation mais assez capable pour un vrai travail : https://strandsagents.com/blog/introducing-strands-decider/ Nous avons ouvert toute la recette, avec l'intégralité des données d'entraînement, le code et le journal de ce que nous avons appris en chemin : https://github.com/strands-labs/strands-deciderVoir le post sur X
TypeSafe répond : le plus dur reste l'intelligence
Chez le cloné, on garde la tête froide. Diogo Almeida, fondateur et PDG de TypeSafe AI, ne voit pas de concurrence réelle émerger pour l'instant, et résume le piège du moment à TechCrunch.
Je comprends que les gens y voient une ruée vers l'or, mais ils sous-estiment peut-être la difficulté de rendre les modèles réellement intelligents. Le lot actuel ressemble plus à des gens du machine learning voulant implémenter une architecture sympa qu'à une équipe dédiée à rendre l'intelligence utile.Diogo Almeida, PDG de TypeSafe AI, à TechCrunch
La remarque vise les dizaines de clones publiés depuis le 15 septembre, Amazon dans le lot, et rejoint une réserve du dépôt d'AWS lui-même : les tâches faciles de JevBench sont saturées (la v19 les réussit toutes), le niveau difficile plafonne à 0,505. La parade proposée est le score de confiance : d'après l'évaluation interne publiée, les réponses émises avec une confiance d'au moins 0,9 sont justes environ 95 % du temps sur des tâches courtes jamais vues.
Le vrai enjeu : borner les agents à bas coût
C'est l'usage qui explique la frénésie. Après une saison d'incidents d'agents, du babillard saccagé sur un wiki à l'enquête du Wall Street Journal sur des agents piratés, vérifier chaque action d'un agent avec un grand modèle ruine l'économie de l'automatisation. Les modèles de décision visent ce poste : routage, choix de l'outil, vérification des arguments d'un appel, garde-fous. Le billet d'AWS décrit un exemple où Strands Decider bloque un appel d'outil météo dont les arguments ne viennent pas de l'utilisateur ; l'agent repose sa question au lieu de deviner la ville.
Se dessine l'agent hybride : le LLM garde les décisions difficiles, le décideur à 115 millisecondes prend les répétitives. Une architecture qu'avait esquissée le DevDay avec GPT-6.1 Sol et l'annulation du modèle frontalier attendu, et que la ruée des clones, géants compris, ancre dans le paysage.
Questions fréquentes
Qu'est-ce que Strands Decider 2B ?
Un modèle de décision open source publié par AWS le 1er octobre 2026 : il choisit entre options prédéfinies et rend un score de confiance calibré, sans générer de texte.
Strands Decider peut-il rédiger ou converser ?
Non, sa tête de génération a été retirée. Pour écrire ou converser, un LLM comme Qwen reste nécessaire, et AWS présente les deux comme complémentaires.
Strands Decider 2B est-il gratuit ?
Oui : code, poids et données d'entraînement sous Apache 2.0 sur GitHub, les poids sur Hugging Face. Seuls l'entraînement ou l'hébergement coûtent.
Quel rapport avec la Decisions API d'OpenAI ?
Le même principe de choix entre options, annoncé deux jours plus tôt, mais en service propriétaire en aperçu limité : voir la Decisions API et Jev.


