Qwen3.8-Flash : Alibaba annonce une API multimodale à 0,16 $ le million de tokens
Le 26 août 2026, Alibaba a annoncé Qwen3.8-Flash, la version de production de son nouveau modèle multimodal, facturée 0,16 $ le million de tokens en entrée et 0,47 $ en sortie. L'API reste annoncée « bientôt disponible » : voici les chiffres officiels et ce qui est déjà vérifiable.

Alibaba a détaillé le 26 août 2026 le versant qui intéresse les développeurs de Qwen3.8-Flash : pas les poids, mais l'API. Le modèle de production, un multimodal de 125 milliards de paramètres dont 6 milliards actifs par token, doit être proposé sur QwenCloud à 0,16 $ le million de tokens en entrée et 0,47 $ en sortie, avec un million de tokens de contexte par défaut et des outils officiels intégrés.
Voici Qwen3.8-Flash, un MoE multimodal et un aperçu précoce de l'architecture Qwen4, désormais en open-weight ! La version de production Qwen3.8-Flash sera bientôt disponible via l'API QwenCloud à seulement 0,16 $ par million de tokens en entrée et 0,47 $ par million de tokens en sortie. 125 milliards de paramètres + 51 milliards de N-gram.Voir le post sur X
Une API annoncée, mais pas encore accessible
La prudence s'impose sur la disponibilité. Le compte officiel Qwen écrit « will be available soon via QwenCloud API », la fiche Hugging Face indique « API coming soon », et nos contrôles du 26 août 2026 à 16 h 40 heure de Paris confirment que rien n'est encore servi : la page officielle qwencloud.com/models/Qwen3.8-Flash renvoie 404, et OpenRouter ne référence toujours que Qwen3.8-27B, Qwen3.8-2.4T-A95B et Qwen3.8-Max. Un article de démonstration de code avec ce modèle serait donc prématuré tant que l'endpoint n'est pas annoncé en ligne.
La distinction de nom reste la clé de lecture : Qwen3.8-Flash est la version de production, servie par API sur QwenCloud avec 1 million de tokens de contexte par défaut et des outils officiels intégrés. Qwen3.8-Flash-Next est la version aux poids ouverts, la première brique publique de l'architecture Qwen4. Les deux partagent la même architecture, mais seul le premier est facturé. Notre analyse de Qwen3.8-Flash-Next couvre les poids, la licence et les benchmarks ; celui-ci se concentre sur l'offre API.
Un prix pensé pour le volume
Le chiffre qui frappe, c'est la comparaison avec le vaisseau amiral. Qwen3.8-Max est facturé 2 $ le million de tokens en entrée et 6 $ en sortie depuis le 3 août 2026. Qwen3.8-Flash est annoncé à 0,16 $ et 0,47 $, soit un rapport d'environ 12,5 sur l'entrée et de 12,8 sur la sortie. Le positionnement est limpide : un modèle à très long contexte destiné à générer des millions de tokens par jour, sans la facture d'un modèle premium.
Ces prix viennent de l'annonce du 26 août 2026 et du billet officiel. Ils peuvent évoluer à l'ouverture effective de l'API, et la grille du cache (tokens mis en cache, création de cache) n'est pas encore publiée pour ce modèle. Au 26 août 2026, aucune page de facturation n'a été confirmée sur la page modèle, toujours absente.
Concrètement : 100 millions de tokens d'entrée par mois, l'ordre de grandeur d'un agent professionnel actif, coûteraient 16 $ au tarif annoncé, contre 200 $ sur Qwen3.8-Max. Le raisonnement en sortie reste le poste dominant, à 0,47 $ le million.
Un million de tokens de contexte, en production
Le modèle n'a rien d'un petit modèle : 125 milliards de paramètres principaux dont 6 milliards activés par token, plus 51 milliards d'embeddings N-gram et 4 milliards pour les modules de prédiction multi-tokens, soit environ 180 milliards au total. Côté contexte, la version ouverte offre 262 144 tokens nativement, extensible à 1 million avec YaRN ; la version de production Qwen3.8-Flash est annoncée avec 1 million de tokens par défaut.
La fiche d'intégration publiée par Qwen dans son billet officiel (la configuration pour Codex) confirme les capacités de la future API : 1 000 000 de tokens de contexte (fenêtre effective à 95 %), entrées texte et image, appels d'outils parallèles et trois niveaux de raisonnement (low, medium, xhigh). Les usages visés sont sans surprise : analyse de documents volumineux, conversations longues, traitement multimodal et agents.
Les chiffres annoncés, avec leurs réserves
Qwen publie un tableau de mesures comparatives. Les lignes les plus parlantes pour un usage API :
| Épreuve | Qwen3.8-Flash | Repère |
|---|---|---|
| Agentic coding, DeepSWE 1.1 | 58,7 | 16,5 pour Qwen3.7-Plus |
| Agentic coding, SWE-bench Pro | 62,5 | 53,4 pour Claude Opus 4.6 (Max) |
| Tâches de bureau longues, CoWorkBench | 73,9 | benchmark interne à Alibaba |
| Usage mobile, AndroidWorld | 84,5 | 81,0 pour Qwen3.7-Plus |
| Maths visuelles, MathVision | 95,7 avec calcul intégré | 90,6 sans |
Source : fiche Hugging Face et billet officiel, valeurs compilées par Qwen, mesurées avec des harnais internes.
Deux précautions de lecture, déjà posées dans notre analyse des poids ouverts :
Toutes ces valeurs viennent d'Alibaba, y compris celles des modèles concurrents. CoWorkBench est un benchmark interne d'Alibaba, sans mesure indépendante au 26 août 2026. Rien ne permet donc de conclure à un dépassement général : ces chiffres indiquent une trajectoire, pas un verdict. Les premiers relevés tiers diront si le rapport prix/performance tient.
Alibaba ajoute que le modèle a été entraîné pour environ un neuvième du coût de Qwen3.7-Plus, avec de meilleurs résultats en code et en bureautique. Un signal surtout industriel : un coût d'entraînement divisé par neuf se répercute structurellement sur les prix d'API.
Ce qui rend l'API rapide et bon marché
L'architecture reprend les quatre chantiers de la génération Qwen4 et en tire une conséquence directe pour l'inférence : l'attention hybride Gated DeltaNet plus Qwen Sparse Attention. Le Gated DeltaNet compresse l'historique dans un état fixe trois couches sur quatre ; la couche d'attention globale utilise QSA, un indexeur léger qui sélectionne des micro-blocs du contexte plutôt que des tokens isolés.
Les chiffres annoncés sur la vitesse sont notables, et bien conditionnels :
À 1 million de tokens, le noyau d'attention QSA atteint « jusqu'à » 7,6× en préremplissage et 4,9× en décodage, selon le billet officiel. Le chiffre de 8,6× le débit de préremplissage par rapport à Qwen3.7-Plus repose sur un « montage expérimental représentatif du serving en ligne » avec un taux de cache de préfixe de 90 %. Ces gains dépendent du matériel, de la longueur du contexte et de la réutilisation réelle du cache : mesurez sur votre propre charge.
La réutilisation du cache de préfixe est précisément l'argument API : un agent qui relit les mêmes documents, une conversation qui s'étend, un traitement batch qui reprend le même préambule, tout cela génère des hits de cache. C'est le même registre qui pousse les plateformes à facturer les tokens mis en cache moins cher.
Comment les développeurs s'y brancheront
Le billet officiel documente l'intégration avec les protocoles du marché :
- Protocole OpenAI Responses via l'endpoint compatible de QwenCloud, avec la configuration Codex fournie en exemple ;
- Protocole Anthropic via l'endpoint dédié, utilisable directement avec Claude Code ;
- Les clients maison Qwen Code (agent terminal open source), Qoder CLI et OpenClaw, tous documentés dans le billet ;
- QwenWork, la plateforme d'agents d'Alibaba, dont le nouveau mode « Standard » est déjà piloté par ce modèle.
Cela veut dire que le jour où l'API ouvre, la plupart des outils existants pourront la consommer sans adaptation, à condition de changer l'URL de base et la clé. Notre fiche Qwen détaille la famille, ses licences et les tarifs de la gamme existante ; le duel face à DeepSeek est traité dans notre comparatif Qwen contre DeepSeek.
Avant de migrer un pipeline vers Qwen3.8-Flash, chiffrez votre coût sur vos propres volumes : tokens d'entrée et de sortie par jour, puis multipliez par 0,16 $ et 0,47 $. À partir de plusieurs dizaines de millions de tokens par mois, l'écart avec Qwen3.8-Max devient le critère principal, avant même les benchmarks.
Au moment de publier, la page officielle du modèle reste absente de QwenCloud et le modèle n'apparaît encore chez aucun agrégateur : l'annonce du 26 août donne le prix, l'architecture et les capacités, mais pas encore la date. Le prochain signal à surveiller est la mise en ligne de la page qwencloud.com/models/Qwen3.8-Flash, premier indicateur tangible d'une ouverture imminente.
Questions fréquentes
Quand l'API Qwen3.8-Flash sera-t-elle disponible ?
La date n'a pas été communiquée : Alibaba écrit « bientôt disponible ». Au 26 août 2026, la page officielle du modèle renvoie 404 et le modèle n'est listé sur aucun agrégateur.
Combien coûtera l'API Qwen3.8-Flash ?
Alibaba annonce 0,16 $ le million de tokens en entrée et 0,47 $ en sortie sur QwenCloud. Ce sont des tarifs annoncés, non confirmés sur une page de facturation.
Quelle différence entre Qwen3.8-Flash et Qwen3.8-Flash-Next ?
Qwen3.8-Flash est la version de production par API, avec 1 million de tokens de contexte par défaut et des outils intégrés. Qwen3.8-Flash-Next est la version aux poids ouverts, présentée comme un aperçu de l'architecture Qwen4.
L'API est-elle compatible avec les outils existants ?
Oui, les deux protocoles OpenAI et Anthropic sont documentés, avec des exemples d'intégration pour Codex, Claude Code, Qwen Code, Qoder et OpenClaw.
Le modèle est-il plus puissant que Qwen3.8-Max ?
Non, les deux ne visent pas la même cible. Qwen3.8-Max, 2 400 milliards de paramètres dont 95 actifs, reste le vaisseau amiral ; Qwen3.8-Flash vise le rapport prix/performance avec 125 milliards de paramètres principaux dont 6 actifs.

