Résumé exécutif¶
Vingt minutes pour l'essentiel : ce qu'est Qwen3.8-Max, ce qu'il coûte, ce qu'il vaut, et ce qu'il ne fait pas.
En trois phrases¶
Le 3 août 2026, l'équipe Qwen d'Alibaba annonce Qwen3.8-Max, un modèle de langage Mixture-of-Experts de 2,4 billions de paramètres dont 95 milliards sont actifs par jeton, avec une fenêtre de contexte d'un million de jetons.
Le 12 août 2026, elle en publie les poids sur Hugging Face — une première pour un modèle de la gamme « Max », jusqu'ici entièrement propriétaire.
Le fichier de configuration livré avec ces poids révèle une architecture que le communiqué ne décrit pas : une alternance de trois couches d'attention linéaire pour une couche d'attention complète, et un routage à 513 experts dont 11 sont évalués par jeton.
La fiche, vérifiée¶
Tous les chiffres de ce tableau ont été recalculés à partir du seul
config.json. La méthode est détaillée en
Vérification des paramètres, le code
est ici.
| Caractéristique | Valeur | Statut |
|---|---|---|
| Paramètres totaux | 2,4198 T (2,4460 T avec MTP) | recalculé, annoncé « 2,4 T » |
| Paramètres actifs / jeton | 95,29 G | recalculé, annoncé « 95 G » |
| Part du modèle activée | 3,94 % | recalculé |
| Couches | 92 | config.json |
| dont attention linéaire | 69 | config.json |
| dont attention complète | 23 | config.json |
| Experts | 512 routés + 1 partagé | config.json |
| Experts actifs / jeton | 10 routés + 1 partagé | config.json |
| Dimension cachée | 8 192 | config.json |
| Vocabulaire | 248 320 jetons | config.json |
| Contexte natif | 262 144 jetons | carte de modèle |
| Contexte étendu | 1 010 000 jetons | carte de modèle |
| Précision livrée | BF16 (variante FP8 disponible) | dépôt |
| Taille du dépôt | 4,89 To, 213 fragments | dépôt |
| Licence | qwen3.8-max (maison) |
fichier LICENSE |
| Modalités des poids ouverts | texte uniquement | carte de modèle |
L'architecture en un paragraphe¶
Le modèle empile 23 fois le motif suivant :
3 × ( Gated DeltaNet → MoE ) puis 1 × ( Attention complète gatée → MoE )
Trois couches sur quatre remplacent l'attention classique — dont le coût croît avec le carré de la longueur du texte — par une attention linéaire à état récurrent dont le coût croît linéairement. La quatrième couche conserve l'attention complète, qui reste nécessaire pour les rappels précis à longue distance.
Chacune des 92 couches est suivie d'un bloc Mixture-of-Experts : 512 experts disponibles, 10 sélectionnés par jeton, plus un expert partagé toujours actif.
La conséquence chiffrée, non publiée par Qwen
Seules les 23 couches d'attention complète produisent un cache clé-valeur. Le calcul donne 92 KiO par jeton, soit :
- 24,7 Go à 262 144 jetons ;
- 95,2 Go à 1 010 000 jetons.
Le même modèle avec 92 couches d'attention complète demanderait 381 Go au million de jetons. L'hybride économise 75 % du cache.
C'est la vraie raison d'être de l'architecture, et elle n'apparaît nulle part dans la communication. Détail en Contexte 262 K et 1 M.
Ce que valent les scores¶
Le tableau officiel¶
Qwen publie 31 lignes de benchmarks comparant Qwen3.8-Max à Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol et à son propre prédécesseur Qwen3.7-Max. Le tableau complet est reproduit en Le tableau officiel.
La lecture honnête de ce tableau donne trois zones :
| Zone | Constat |
|---|---|
| Le modèle domine | PaperBench (93,0 contre 90,5 au mieux), IFBench (82,8), WideSearch (81,9), HealthBench (60,2), finance et droit |
| Le modèle est au niveau | GPQA Diamond (92,6), MRCR long contexte (92,9), CoWorkBench, WorkSpaceBench |
| Le modèle décroche | SWE-bench Pro (67,7 contre 80,0 pour Fable 5), FrontierSWE (73,5 contre 88,8), DeepSWE (56,6 contre 73,0), HLE (43,6 contre 53,3) |
Autrement dit : excellent en recherche, en rédaction et en usage bureautique ; en retrait sur le codage à l'échelle du dépôt, précisément le domaine que le communiqué met en avant.
Six lignes sur trente et une sont des benchmarks maison
QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench sont
conçus et exécutés par Qwen. Un modèle qui gagne sur son propre benchmark
n'établit rien. Ces lignes doivent être lues comme de la communication, pas
comme de la mesure.
Les évaluations indépendantes¶
Ce sont les seules qui comptent vraiment.
| Évaluateur | Résultat |
|---|---|
| Artificial Analysis — indice d'intelligence | 58, 10ᵉ sur 184 modèles |
| Artificial Analysis — vitesse de sortie | 47,0 jetons/s, 119ᵉ sur 184 (médiane de la catégorie : 67,7) |
| Artificial Analysis — délai au premier jeton | 2,72 s |
| Vals AI — Vals Index | 66,1 % |
| LMArena — Vision Arena | 2ᵉ (mais sur la version API, pas sur les poids) |
| LMArena — Frontend Code Arena | 4ᵉ, 1 668 Elo |
Le modèle est lent
47 jetons par seconde contre une médiane de 67,7 pour les modèles de
raisonnement comparables, avec un raisonnement forcé à l'effort xhigh par
défaut et facturé en sortie. Sur des tâches agentiques longues, c'est le
facteur limitant réel — bien avant le prix affiché.
Le prix¶
| Poste | Tarif (par million de jetons) |
|---|---|
| Entrée | 2,00 $ |
| Sortie | 6,00 $ |
| Entrée en cache implicite | 0,25 $ |
| Création de cache explicite | 2,50 $ |
| Lecture de cache explicite | 0,17 $ |
Un tarif unique sur toute la fenêtre d'un million de jetons — pas de palier selon la longueur, contrairement à plusieurs concurrents.
Les jetons de raisonnement sont facturés en sortie
L'effort de raisonnement par défaut est xhigh, et il ne peut pas être
désactivé. Le budget de raisonnement monte à 262 144 jetons. La facture
réelle dépasse donc largement le nombre de jetons visibles dans la réponse.
Voir Coûts.
Les trois choses que le communiqué ne dit pas¶
1. Les poids ouverts ne sont pas le modèle de l'API¶
La carte de modèle est explicite : le checkpoint publié est textuel, sans
entrée visuelle, et le mode raisonnement y est impossible à désactiver.
L'API qwen3.8-max, elle, accepte texte, images et vidéos.
Conséquence directe : le 2ᵉ rang en Vision Arena ne concerne pas le fichier téléchargeable. Voir Licence et disponibilité.
2. La licence n'est pas Apache 2.0¶
Les lignées Qwen3.5 et Qwen3.6 étaient sous Apache 2.0. Qwen3.8-Max sort sous
une licence maison nommée qwen3.8-max, qui impose :
- l'affichage du nom du modèle dans l'interface au-delà de 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenu mensuel ;
- une licence commerciale distincte pour un opérateur de Model-as-a-Service ou d'assistant de travail dépassant 50 millions de dollars sur douze mois glissants.
Ce sont des seuils élevés — la plupart des usages ne les atteignent jamais — mais la rupture avec Apache 2.0 est réelle et doit être vérifiée avant engagement.
3. Personne ne fait tourner ces poids chez soi¶
4,89 To de poids en BF16. Le calcul complet, cache d'un million de jetons inclus, donne :
| Précision | H100/H200 80 Go | B200 180 Go |
|---|---|---|
| BF16 | 74 GPU | 33 GPU |
| FP8 | 38 GPU | 17 GPU |
| 4 bits | 20 GPU | 9 GPU |
« Poids ouverts » signifie ici auditable et reproductible, pas auto-hébergeable. Voir Exécuter les poids.
Face à Kimi K3¶
Les deux modèles sortent à deux semaines d'écart et visent la même place.
| Kimi K3 | Qwen3.8-Max | |
|---|---|---|
| Paramètres | 2,78 T | 2,42 T |
| Actifs / jeton | 104 G | 95 G |
| Contexte | 1 048 576 | 262 144 natif, 1 010 000 étendu |
| Rapport technique | oui, 80 pages sur arXiv | non |
| Multimodal dans les poids | oui | non |
| Licence | permissive | maison, à seuils |
| Taille du dépôt | 1,56 To | 4,89 To |
Kimi K3 est le mieux documenté ; Qwen3.8-Max est le plus économe en calcul actif. Sur l'indice d'Artificial Analysis, Kimi K3 devance Qwen3.8-Max.
Analyse détaillée : Kimi K3.
Verdict en une ligne¶
Un modèle fort en recherche, en rédaction longue et en usage bureautique, en retrait sur le codage à l'échelle du dépôt malgré la communication, lent, remarquablement peu cher, et dont la publication des poids est un geste industriel majeur — mais un geste dont presque personne ne peut se servir directement.
Pour le détail de chaque affirmation et son niveau de preuve : Affirmations à vérifier.