Outils Intelligence Artificielle
Accueil/ Actualités/ Modèles/ Qwen3.8-Flash-Next : Alibaba ouvre les poids d'un aperçu de l'architecture Qwen4
Modèles · 9 min de lecture

Qwen3.8-Flash-Next : Alibaba ouvre les poids d'un aperçu de l'architecture Qwen4

Le 26 août 2026, Alibaba a ouvert les poids de Qwen3.8-Flash-Next, un modèle multimodal de 125 milliards de paramètres principaux dont 6 milliards actifs par token, présenté comme un aperçu de l'architecture Qwen4. Pour la future API QwenCloud, Alibaba annonce un tarif de 0,16 $ le million de tokens en entrée et 0,47 $ en sortie.

Illustration

Le 26 août 2026, l'équipe Qwen d'Alibaba a annoncé sur son compte X l'arrivée de Qwen3.8-Flash, la version de production d'un modèle multimodal de type mélange d'experts. Le point qui compte : ce sont les poids, publiés sous le nom Qwen3.8-Flash-Next, qui sont ouverts, parce qu'ils constituent la première brique publique de l'architecture qui accueillera la génération Qwen4. La famille Qwen, sa gamme et ses licences sont détaillées dans notre fiche Qwen.

𝕏Qwen (@Alibaba_Qwen) · 26 août 2026 · traduit de l'anglais
Voici Qwen3.8-Flash, un MoE multimodal et un aperçu précoce de l'architecture Qwen4, désormais en open-weight ! La version de production Qwen3.8-Flash sera bientôt disponible via l'API QwenCloud à seulement 0,16 $ par million de tokens en entrée et 0,47 $ par million de tokens en sortie. 125 milliards de paramètres + 51 milliards de N-gram.
Voir le post sur X

La déclinaison orientée API (tarifs, intégrations, cache) est traitée dans notre article dédié Qwen3.8-Flash par l'API. Deux noms, un seul modèle, et une confusion possible. Qwen3.8-Flash-Next désigne le modèle aux poids publiés, décrit sur Hugging Face comme « A Preview of the Qwen4 Architecture ». Qwen3.8-Flash est la version de production hébergée sur QwenCloud, avec 1 million de tokens de contexte par défaut et des outils officiels intégrés, dont l'API n'est pas encore ouverte au moment où nous écrivons. Le modèle ouvert, lui, est téléchargeable dès maintenant.

À retenir · l'essentiel
Le faitAlibaba ouvre les poids de Qwen3.8-Flash-Next le 26 août 2026, un MoE multimodal de 125 milliards de paramètres principaux dont 6 milliards activés par token, plus 51 milliards d'embeddings N-gram et 4 milliards pour le MTP, soit environ 180 milliards au total.
Le point stratégiqueLe modèle est présenté comme un aperçu de l'architecture Qwen4, à la manière de Qwen3-Next qui avait ouvert la voie à Qwen3.5.
Les chiffresAlibaba annonce 0,16 $ le million de tokens en entrée et 0,47 $ en sortie pour la future API QwenCloud, contre 2 $ et 6 $ pour Qwen3.8-Max.
La réserveLes scores publiés sont ceux d'Alibaba, et le modèle ne gagne pas partout : DeepSeek-V4-Flash le devance sur la génération de code niveau dépôt, Claude Opus 4.6 sur le raisonnement multidisciplinaire.

Qwen3.8-Flash-Next, c'est quoi exactement ?

Le modèle est un mélange d'experts multimodal : un encodeur de vision lui permet de traiter images, documents et interfaces, et le transformateur de langage est découpé en 512 experts parmi lesquels un routeur n'en active qu'une petite partie à chaque token. La fiche officielle détaille les chiffres sur un seul tableau : 125 milliards de paramètres principaux, dont 6 milliards activés par token, auxquels s'ajoutent 51 milliards de paramètres d'embeddings N-gram et 4 milliards pour les modules de prédiction multi-tokens. Le total approche donc 180 milliards de paramètres ; sur ces 180 milliards, seuls 6 sont réellement calculés à chaque token.

La fenêtre de contexte est de 262 144 tokens nativement, extensible à 1 million de tokens avec YaRN. Côté inférence, la page Hugging Face liste la compatibilité avec Transformers, vLLM, SGLang et TokenSpeed, et le dépôt QwenLM/Qwen3.8-Flash-Next est accompagné d'un rapport technique PDF.

Les poids sont en ligne sur Hugging Face et ModelScope. Le premier commit du dépôt Hugging Face est daté du 26 août 2026 à 10 h 17 heure de Paris, suivi d'une mise à jour de la fiche à 14 h 29. Autre indice du statut expérimental : le tag d'architecture sur ModelScope est `Qwen4ExpForConditionalGeneration`, « Qwen4 expérimental ».

Une nouvelle architecture, quatre chantiers

Alibaba ne dit pas « voici un modèle plus gros ». Il dit « voici comment nous construisons Qwen4, regardez avant ». Le précédent existe : Qwen3-Next-80B-A3B, sorti en septembre 2025, inaugurait l'attention hybride Gated DeltaNet plus Gated Attention, une recette reprise ensuite par toute la famille Qwen3.5 à Qwen3.8. Le bloc hybride de Qwen3.8-Flash-Next relit les quatre étages qui définissent la génération suivante.

L'attention. Le Gated DeltaNet compresse l'historique dans un état de taille fixe, trois couches sur quatre. La couche d'attention globale, elle, abandonne l'indexeur au niveau du token pour un indexeur qui travaille au niveau du micro-bloc. Qwen Sparse Attention (QSA) ne sélectionne plus des positions isolées mais des régions entières du contexte, ce qui réduit à la fois le coût de l'attention sur les longues séquences et le coût de l'indexage lui-même. En une formule de Qwen : GDN « se souvient », QSA « retrouve ».

Le résidu. Le résidu gated (Gated Residual) élargit le flux résiduel en quatre branches et contrôle les lectures et écritures par des portes dynamiques. Le bénéfice annoncé est une meilleure circulation de l'information entre couches, sans sacrifier la stabilité d'entraînement.

L'embedding. Les embeddings N-gram reposent sur des recherches déterministes et n'ajoutent pas de coût de multiplication matricielle par token, mais ils consomment de la mémoire et du temps d'accès. Le contexte local sert d'index sur des bigrammes et trigrammes insérés à la couche 2, ce qui permet de faire grossir la capacité du modèle sans augmenter le calcul par token. La table peut être déportée en mémoire hôte et accédée par préchargement asynchrone, pendant que le reste du modèle calcule.

L'optimisation. L'entraînement utilise l'optimiseur Muon, réglé sur la précision d'orthogonalisation, en binôme réparti avec AdamW, avec les lois d'échelle recalibrées pour la nouvelle architecture. Les warmups de taille de lot sont supprimés : l'entraînement démarre directement à la taille cible.

Le schéma d'architecture publié par Qwen : à gauche, la pile alternant couches GDN et couches QSA ; à droite, le détail d'un bloc hybride avec les portes résiduelles (GR Read, GR Write) et les modules MoE. Au bas, les embeddings de vocabulaire et la couche N-gram, présente seulement à la couche 2.
Le schéma d'architecture publié par Qwen : à gauche, la pile alternant couches GDN et couches QSA ; à droite, le détail d'un bloc hybride avec les portes résiduelles (GR Read, GR Write) et les modules MoE. Au bas, les embeddings de vocabulaire et la couche N-gram, présente seulement à la couche 2.

Le bilan d'Alibaba est net : à capacité équivalente, l'entraînement de Qwen3.8-Flash-Next coûte environ un neuvième de celui de Qwen3.7-Plus, pour des capacités supérieures en code et en tâches de bureau. Le jeu en vaut la chandelle pour l'éditeur comme pour les développeurs : ceux-ci peuvent adapter les runtimes, la quantification et les outils de déploiement avant même l'arrivée de la gamme Qwen4 complète.

Les benchmarks : où Qwen gagne, et où il perd

Le tableau ci-dessous est compilé par Qwen à partir de ses propres mesures : Alibaba compare son modèle à Qwen3.8-27B, à Qwen3.7-Plus (397 milliards au total, 17 actifs), à DeepSeek-V4-Flash-0731 (284 milliards, 13 actifs) et à Claude Opus 4.6 en version Max. Le duel Qwen contre DeepSeek est détaillé dans notre comparatif.

ÉpreuveQwen3.8-Flash-NextDeepSeek-V4-FlashClaude Opus 4.6 (Max)
Agentic coding, DeepSWE 1.158,754,4
Agentic coding, SWE-bench Pro62,556,053,4
Génération de code niveau dépôt, NL2Repo-Bench48,154,247,6
Tâches de bureau longues, CoWorkBench73,945,168,2
Tâches professionnelles, JobBench55,741,336,6
Instruction following, IFBench81,379,262,5
Raisonnement scientifique, GPQA Diamond91,790,891,3
Raisonnement multidisciplinaire, HLE35,933,840,0
Compétition de code, LiveCodeBench v691,990,688,8

Source : fiche Hugging Face officielle, valeurs reportées par Alibaba et mises en gras dans le tableau d'origine.

Le modèle est premier sur la majorité des lignes, et il ne l'est pas partout : DeepSeek-V4-Flash le dépasse sur la génération de code niveau dépôt (54,2 contre 48,1), Claude Opus 4.6 sur le raisonnement multidisciplinaire (40,0 contre 35,9), et sur les tâches agentiques de frontière, DeepSeek-V4-Flash obtient le meilleur Pass@1 (25,2 contre 24,3), tandis que son score global n'est pas renseigné dans le tableau. Il n'est donc pas possible d'affirmer que Qwen domine cette métrique au score global. Comme pour Qwen3.8-Max, il faut lire ces chiffres comme des scores d'éditeur.

!
Des scores maison, et un benchmark maison

Tous les chiffres viennent d'Alibaba, y compris ceux des concurrents, mesurés par Qwen avec ses propres harnais. Le DeepSWE 1.1 est évalué avec les harnais Claude Code et mini-SWE-agent, et la fiche précise que la meilleure des deux mesures est retenue ; le SWE-bench Pro l'est avec le harnais Claude Code, sauf pour Claude Opus 4.6 qui reprend son score publié. Surtout, la ligne CoWorkBench est un benchmark interne d'Alibaba pour les tâches de bureau : aucune mesure indépendante ne couvre cette épreuve au 26 août 2026. Ces comparaisons ne constituent donc pas une validation indépendante complète, et le bon réflexe reste d'attendre les premiers relevés externes avant de conclure.

Côté multimodal, les écarts les plus marquants portent sur l'usage d'ordinateur : Qwen3.8-Flash-Next obtient 84,5 sur AndroidWorld (contre 81,0 pour Qwen3.7-Plus) et 19,4 en score binaire sur OSWorld 2.0, contre 2,8 pour Qwen3.7-Plus. Sur les autres épreuves de vision, les gains sont plus modestes : +2,5 points sur ERQA (72,3 contre 69,8) et +0,4 point seulement sur LVBench (76,6 contre 76,2).

Combien ça coûtera ?

Alibaba annonce un tarif de 0,16 $ le million de tokens en entrée et 0,47 $ en sortie pour la future API QwenCloud de Qwen3.8-Flash. L'API elle-même est indiquée « bientôt disponible » et n'était pas ouverte au 26 août 2026. À titre de comparaison, Qwen3.8-Max, le vaisseau amiral de la famille, est facturé 2 $ et 6 $ depuis le 3 août 2026. Le binôme Flash et Max, déjà présent dans la famille, place ce modèle résolument en bas de la fourchette tarifaire, la version production annoncée promettant 1 million de tokens de contexte par défaut et des outils officiels intégrés.

Au tarif annoncé, un million de tokens en entrée coûte 0,16 $, contre 2 $ sur Qwen3.8-Max. Pour les usages à fort volume, traitement de documents, agents, extraction de notes, le différentiel est d'un facteur supérieur à dix sur l'entrée.

Le visuel officiel du post X du 26 août 2026 : le nom du modèle, la mention « Now Available » et le sous-titre « Qwen3.8-Flash-Next: Now Open Weights ».
Le visuel officiel du post X du 26 août 2026 : le nom du modèle, la mention « Now Available » et le sous-titre « Qwen3.8-Flash-Next: Now Open Weights ».

Et en local ?

C'est la question que pose immédiatement l'ouverture des poids, et la réponse est nuancée. Le modèle principal de 125 milliards de paramètres tient mal sur une machine de bureau, mais les embeddings N-gram changent la donne : 51 milliards de paramètres à lecture déterministe, sans multiplication matricielle par token, qui peuvent vivre en mémoire hôte, au prix d'une empreinte mémoire et d'un temps d'accès réels. Qwen publie d'ailleurs FlashQLA, un dépôt dédié à la quantification à précision faible, en complément du rapport technique.

Une estimation partagée sur Reddit le jour même évalue la version 4-bit idéale autour de 82 Go de mémoire au total, dont environ 58 Go de poids principaux et 24 Go de tables N-gram. C'est un ordre de grandeur théorique issu d'une discussion communautaire, pas une configuration confortable sur un ordinateur classique : les échanges autour du modèle tournent d'ailleurs autour des machines monoplace à mémoire unifiée, type DGX Spark, plutôt que des cartes gaming.

Astuce

Si le modèle vous intéresse pour du traitement de longs documents, ne vous précipitez pas sur du matériel : dès que l'API Qwen3.8-Flash ouvre sur QwenCloud, comparez votre scénario sur la version production, qui promet 1 million de tokens de contexte par défaut et des outils intégrés. Au tarif annoncé, l'API devrait rester moins chère qu'une machine locale pour un usage intermittent.

Poids ouverts ne veut pas dire Apache 2.0

Depuis le 26 août, la famille Qwen affiche deux licences différentes sur ses poids récents. Qwen3.8-27B, publié début août, reste sous licence Apache 2.0. Qwen3.8-Flash-Next est sous Qwen Community License 1.0, un texte calqué sur le permis MIT mais qui ajoute deux conditions : au-delà de 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, le nom du modèle doit être affiché dans l'interface ; et un accord séparé est requis pour exploiter le modèle en model as a service ou en assistant de travail IA à des fins commerciales.

La nuance est importante pour les hébergeurs et les start-ups qui voudraient s'appuyer sur ces poids : « open-weight » signifie ici que les fichiers sont téléchargeables, pas que la licence échappe à toute condition d'exploitation. Les deux licences maison de la famille sont de structure comparable, mais pas identiques : la Qwen3.8-Max License, qui encadre depuis le 9 août les poids du vaisseau amiral, ne réclame l'accord séparé qu'au-delà de certains volumes, alors que la Qwen Community License 1.0 l'exige pour toute activité commerciale de model as a service ou d'assistant de travail IA, sans seuil de revenus. Détail dans notre analyse de Qwen3.8-Max.

Les chiffres du lancement
125 Md
de paramètres principaux, dont 6 Md activés par token
51 Md
d'embeddings N-gram, à lecture déterministe sans coût de multiplication matricielle
~180 Md
au total, MTP compris, selon la fiche Hugging Face
0,16 $ / 0,47 $
annoncés par million de tokens, en entrée et en sortie, sur QwenCloud
262 K à 1 M
tokens de contexte, natif puis via YaRN
Le fil des événements
Septembre 2025Qwen3-Next-80B-A3B inaugure l'attention hybride GDN plus Gated Attention.
3 août 2026Qwen3.8-Max, 2 400 milliards de paramètres dont 95 actifs, est annoncé avec une promesse d'ouverture des poids.
Août 2026Qwen3.8-27B est publié sous licence Apache 2.0, dense et sans N-gram.
9 août 2026Premier commit du dépôt des poids de Qwen3.8-Max sur Hugging Face, à 05 h 56 heure de Paris, sous licence maison.
26 août 2026Premier commit du dépôt Qwen/Qwen3.8-Flash-Next, à 10 h 17 heure de Paris : ouverture des poids et annonce de la version production Qwen3.8-Flash à 0,16 $ le million de tokens en entrée.

Le pari d'Alibaba est celui de l'écart temporel : exposer l'architecture avant la famille complète pour que la communauté la valide en production, comme Qwen3-Next l'avait fait pour Qwen3.5. Les développeurs disposent dès aujourd'hui des poids, de la fiche technique et du dépôt FlashQLA, avec un produit final à un prix qui renverse le rapport habituel de la gamme Max. La suite de la famille Qwen4, elle, n'a toujours pas de date.

Questions fréquentes

Qu'est-ce que Qwen3.8-Flash ?

C'est la version de production du modèle Qwen3.8-Flash-Next, annoncée le 26 août 2026 par Alibaba. Hébergée sur QwenCloud, elle doit être facturée 0,16 $ le million de tokens en entrée et 0,47 $ en sortie ; l'API est indiquée « bientôt disponible ».

Quelle est la différence entre Qwen3.8-Flash et Qwen3.8-Flash-Next ?

Qwen3.8-Flash-Next est la version aux poids ouverts, décrite par Qwen comme un aperçu de l'architecture Qwen4. Qwen3.8-Flash est la version de production avec 1 million de tokens de contexte par défaut et des outils intégrés, dont l'API est prévue bientôt.

Qwen3.8-Flash-Next est-il gratuit et libre d'usage ?

Les poids sont téléchargeables gratuitement sur Hugging Face et ModelScope, mais sous Qwen Community License 1.0 : affichage du nom du modèle au-delà de 100 millions d'utilisateurs mensuels ou de 20 millions de dollars de revenus mensuels, et accord séparé pour l'exploitation en model as a service commercial.

Le modèle est-il plus puissant que Qwen3.8-Max ?

Les deux ne jouent pas la même partie. Qwen3.8-Max, 2 400 milliards de paramètres dont 95 actifs, reste le vaisseau amiral ; Qwen3.8-Flash vise le rapport prix/performance, avec 125 milliards de paramètres principaux dont 6 actifs, et des scores d'éditeur en net progrès face aux modèles de sa taille.

Peut-on faire tourner Qwen3.8-Flash-Next en local ?

Oui, avec des moyens conséquents : une estimation communautaire évoque environ 82 Go de mémoire en 4-bit, dont 58 Go de poids principaux et 24 Go de tables N-gram. Qwen fournit le dépôt FlashQLA pour la quantification.