Aller au contenu

Résumé exécutif

Vingt minutes pour l'essentiel : ce qu'est Qwen3.8-Max, ce qu'il coûte, ce qu'il vaut, et ce qu'il ne fait pas.


En trois phrases

Le 3 août 2026, l'équipe Qwen d'Alibaba annonce Qwen3.8-Max, un modèle de langage Mixture-of-Experts de 2,4 billions de paramètres dont 95 milliards sont actifs par jeton, avec une fenêtre de contexte d'un million de jetons.

Le 12 août 2026, elle en publie les poids sur Hugging Face — une première pour un modèle de la gamme « Max », jusqu'ici entièrement propriétaire.

Le fichier de configuration livré avec ces poids révèle une architecture que le communiqué ne décrit pas : une alternance de trois couches d'attention linéaire pour une couche d'attention complète, et un routage à 513 experts dont 11 sont évalués par jeton.


La fiche, vérifiée

Tous les chiffres de ce tableau ont été recalculés à partir du seul config.json. La méthode est détaillée en Vérification des paramètres, le code est ici.

Caractéristique Valeur Statut
Paramètres totaux 2,4198 T (2,4460 T avec MTP) recalculé, annoncé « 2,4 T »
Paramètres actifs / jeton 95,29 G recalculé, annoncé « 95 G »
Part du modèle activée 3,94 % recalculé
Couches 92 config.json
dont attention linéaire 69 config.json
dont attention complète 23 config.json
Experts 512 routés + 1 partagé config.json
Experts actifs / jeton 10 routés + 1 partagé config.json
Dimension cachée 8 192 config.json
Vocabulaire 248 320 jetons config.json
Contexte natif 262 144 jetons carte de modèle
Contexte étendu 1 010 000 jetons carte de modèle
Précision livrée BF16 (variante FP8 disponible) dépôt
Taille du dépôt 4,89 To, 213 fragments dépôt
Licence qwen3.8-max (maison) fichier LICENSE
Modalités des poids ouverts texte uniquement carte de modèle

L'architecture en un paragraphe

Le modèle empile 23 fois le motif suivant :

3 × ( Gated DeltaNet → MoE )   puis   1 × ( Attention complète gatée → MoE )

Trois couches sur quatre remplacent l'attention classique — dont le coût croît avec le carré de la longueur du texte — par une attention linéaire à état récurrent dont le coût croît linéairement. La quatrième couche conserve l'attention complète, qui reste nécessaire pour les rappels précis à longue distance.

Chacune des 92 couches est suivie d'un bloc Mixture-of-Experts : 512 experts disponibles, 10 sélectionnés par jeton, plus un expert partagé toujours actif.

La conséquence chiffrée, non publiée par Qwen

Seules les 23 couches d'attention complète produisent un cache clé-valeur. Le calcul donne 92 KiO par jeton, soit :

  • 24,7 Go à 262 144 jetons ;
  • 95,2 Go à 1 010 000 jetons.

Le même modèle avec 92 couches d'attention complète demanderait 381 Go au million de jetons. L'hybride économise 75 % du cache.

C'est la vraie raison d'être de l'architecture, et elle n'apparaît nulle part dans la communication. Détail en Contexte 262 K et 1 M.


Ce que valent les scores

Le tableau officiel

Qwen publie 31 lignes de benchmarks comparant Qwen3.8-Max à Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol et à son propre prédécesseur Qwen3.7-Max. Le tableau complet est reproduit en Le tableau officiel.

La lecture honnête de ce tableau donne trois zones :

Zone Constat
Le modèle domine PaperBench (93,0 contre 90,5 au mieux), IFBench (82,8), WideSearch (81,9), HealthBench (60,2), finance et droit
Le modèle est au niveau GPQA Diamond (92,6), MRCR long contexte (92,9), CoWorkBench, WorkSpaceBench
Le modèle décroche SWE-bench Pro (67,7 contre 80,0 pour Fable 5), FrontierSWE (73,5 contre 88,8), DeepSWE (56,6 contre 73,0), HLE (43,6 contre 53,3)

Autrement dit : excellent en recherche, en rédaction et en usage bureautique ; en retrait sur le codage à l'échelle du dépôt, précisément le domaine que le communiqué met en avant.

Six lignes sur trente et une sont des benchmarks maison

QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench sont conçus et exécutés par Qwen. Un modèle qui gagne sur son propre benchmark n'établit rien. Ces lignes doivent être lues comme de la communication, pas comme de la mesure.

Les évaluations indépendantes

Ce sont les seules qui comptent vraiment.

Évaluateur Résultat
Artificial Analysis — indice d'intelligence 58, 10ᵉ sur 184 modèles
Artificial Analysis — vitesse de sortie 47,0 jetons/s, 119ᵉ sur 184 (médiane de la catégorie : 67,7)
Artificial Analysis — délai au premier jeton 2,72 s
Vals AI — Vals Index 66,1 %
LMArena — Vision Arena 2ᵉ (mais sur la version API, pas sur les poids)
LMArena — Frontend Code Arena 4ᵉ, 1 668 Elo

Le modèle est lent

47 jetons par seconde contre une médiane de 67,7 pour les modèles de raisonnement comparables, avec un raisonnement forcé à l'effort xhigh par défaut et facturé en sortie. Sur des tâches agentiques longues, c'est le facteur limitant réel — bien avant le prix affiché.


Le prix

Poste Tarif (par million de jetons)
Entrée 2,00 $
Sortie 6,00 $
Entrée en cache implicite 0,25 $
Création de cache explicite 2,50 $
Lecture de cache explicite 0,17 $

Un tarif unique sur toute la fenêtre d'un million de jetons — pas de palier selon la longueur, contrairement à plusieurs concurrents.

Les jetons de raisonnement sont facturés en sortie

L'effort de raisonnement par défaut est xhigh, et il ne peut pas être désactivé. Le budget de raisonnement monte à 262 144 jetons. La facture réelle dépasse donc largement le nombre de jetons visibles dans la réponse. Voir Coûts.


Les trois choses que le communiqué ne dit pas

1. Les poids ouverts ne sont pas le modèle de l'API

La carte de modèle est explicite : le checkpoint publié est textuel, sans entrée visuelle, et le mode raisonnement y est impossible à désactiver. L'API qwen3.8-max, elle, accepte texte, images et vidéos.

Conséquence directe : le 2ᵉ rang en Vision Arena ne concerne pas le fichier téléchargeable. Voir Licence et disponibilité.

2. La licence n'est pas Apache 2.0

Les lignées Qwen3.5 et Qwen3.6 étaient sous Apache 2.0. Qwen3.8-Max sort sous une licence maison nommée qwen3.8-max, qui impose :

  • l'affichage du nom du modèle dans l'interface au-delà de 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenu mensuel ;
  • une licence commerciale distincte pour un opérateur de Model-as-a-Service ou d'assistant de travail dépassant 50 millions de dollars sur douze mois glissants.

Ce sont des seuils élevés — la plupart des usages ne les atteignent jamais — mais la rupture avec Apache 2.0 est réelle et doit être vérifiée avant engagement.

3. Personne ne fait tourner ces poids chez soi

4,89 To de poids en BF16. Le calcul complet, cache d'un million de jetons inclus, donne :

Précision H100/H200 80 Go B200 180 Go
BF16 74 GPU 33 GPU
FP8 38 GPU 17 GPU
4 bits 20 GPU 9 GPU

« Poids ouverts » signifie ici auditable et reproductible, pas auto-hébergeable. Voir Exécuter les poids.


Face à Kimi K3

Les deux modèles sortent à deux semaines d'écart et visent la même place.

Kimi K3 Qwen3.8-Max
Paramètres 2,78 T 2,42 T
Actifs / jeton 104 G 95 G
Contexte 1 048 576 262 144 natif, 1 010 000 étendu
Rapport technique oui, 80 pages sur arXiv non
Multimodal dans les poids oui non
Licence permissive maison, à seuils
Taille du dépôt 1,56 To 4,89 To

Kimi K3 est le mieux documenté ; Qwen3.8-Max est le plus économe en calcul actif. Sur l'indice d'Artificial Analysis, Kimi K3 devance Qwen3.8-Max.

Analyse détaillée : Kimi K3.


Verdict en une ligne

Un modèle fort en recherche, en rédaction longue et en usage bureautique, en retrait sur le codage à l'échelle du dépôt malgré la communication, lent, remarquablement peu cher, et dont la publication des poids est un geste industriel majeur — mais un geste dont presque personne ne peut se servir directement.

Pour le détail de chaque affirmation et son niveau de preuve : Affirmations à vérifier.