Qwen3.8-Max : analyse complète¶
Le premier modèle de classe « Max » dont Alibaba publie les poids — 2,4 billions de paramètres, et un fichier de configuration qui en dit plus que le communiqué.
Ce que contient cette recherche¶
Une analyse de Qwen3.8-Max, annoncé le 3 août 2026 par l'équipe Qwen
d'Alibaba et publié en poids ouverts le 12 août 2026 sous le nom
Qwen/Qwen3.8-2.4T-A95B.
Ce rapport a une particularité méthodologique qu'il faut poser d'emblée :
Il n'existe aucun rapport technique
Contrairement à Kimi K3, qui s'accompagne d'un document de 80 pages sur arXiv, Qwen3.8-Max n'a ni papier, ni rapport technique, ni description d'entraînement. Le communiqué officiel se contente de la formule « built upon the architectural foundation of Qwen 3.5 » et d'un « hybrid attention mechanism ».
Tout ce que l'on sait de précis sur l'architecture vient donc d'une seule
source : le fichier config.json livré avec les poids. Ce rapport le lit
ligne par ligne, et recalcule tout ce qui peut l'être.
| Objectif | Comprendre l'architecture réelle du modèle, vérifier les chiffres annoncés, et savoir ce que l'on peut ou non en faire |
| Public | Toute personne curieuse des grands modèles de langage — aucun prérequis |
| Prérequis | Aucun. La partie Fondations construit le vocabulaire |
| Volume | 8 parties, 33 chapitres |
| Temps de lecture | 5 à 7 h pour l'intégralité · 20 min pour le résumé exécutif |
| Difficulté | Progressive : ★☆☆ (Fondations) → ★★★★ (Architecture) |
| Créé le | 13 août 2026 |
| Dernière révision | 15 août 2026 |
Qwen3.8-Max en une phrase
Un Mixture-of-Experts de 2,42 billions de paramètres dont 95 milliards sont actifs par jeton, bâti sur une alternance 3 couches d'attention linéaire pour 1 couche d'attention complète, avec un contexte natif de 262 144 jetons extensible à 1 010 000, publié sous une licence maison — et sans les capacités visuelles de la version API.
Ce que cette recherche apporte de plus que le communiqué¶
Des vérifications indépendantes, toutes reproductibles
Un script en Python pur, sans aucune dépendance,
part du seul config.json et reconstruit les chiffres annoncés :
| Vérification | Calculé | Annoncé / observé | Écart |
|---|---|---|---|
| Paramètres totaux | 2,4198 T | 2,4 T | 0,83 % |
| Paramètres actifs par jeton | 95,29 G | 95 G | 0,30 % |
| Taille du dépôt en BF16 | 4,89 To | 4,89 To | 0,04 % |
La troisième ligne n'est pas une coïncidence : elle établit que la couche de prédiction multi-jetons est bel et bien dans les poids livrés, ce que la carte de modèle ne dit nulle part. Voir Vérification des paramètres.
Deux résultats que la presse n'a pas relevés
-
Le modèle téléchargeable n'est pas le modèle de l'API. Les poids ouverts sont exclusivement textuels, et le mode raisonnement y est impossible à désactiver. La version API, elle, accepte images et vidéos. Les scores de « Vision Arena » ne concernent donc pas le fichier que vous téléchargez. Voir Licence et disponibilité.
-
L'attention hybride divise par quatre le coût du contexte long. À 1 010 000 jetons, le cache clé-valeur pèse 95 Go au lieu des 381 Go qu'exigerait la même architecture en attention complète — le chiffre n'est publié nulle part, il se déduit de
config.json. Voir Contexte 262 K et 1 M.
Par où commencer¶
| Vous êtes… | Commencez par |
|---|---|
| Pressé | Résumé exécutif — 20 minutes |
| Débutant complet | Fondations, dans l'ordre |
| Familier des LLM | Architecture · Vue d'ensemble |
| Vous voulez l'utiliser | Utilisation |
| Vous voulez juger | Analyse critique |
Le chapitre Parcours de lecture détaille chaque itinéraire.
Les huit parties¶
Fondations — 6 chapitres¶
Le cours d'entrée : jetons, Transformer et attention, attention linéaire et DeltaNet, Mixture-of-Experts, cache clé-valeur, quantification et matériel.
Aucun prérequis · ~2 h · ★☆☆
Présentation — 4 chapitres¶
Alibaba et la lignée Qwen, ce que l'annonce affirme, la fiche technique complète, la licence maison et ses conditions.
~45 min · ★☆☆
Architecture — 6 chapitres¶
Le cœur du rapport. L'alternance 3:1, Gated DeltaNet, l'attention complète gatée, le MoE à 513 experts, la prédiction multi-jetons, l'arithmétique du contexte long — avec les formules et leur explication.
~1 h 30 · ★★★★
Évaluations — 4 chapitres¶
Le tableau officiel de 31 lignes reproduit intégralement, les évaluations indépendantes, les démonstrations agentiques, et ce qu'il faut en penser.
~1 h · ★★☆
Utilisation — 3 chapitres¶
Par l'API, ou en exécutant les poids — avec le décompte honnête du matériel nécessaire. Et le calcul du coût réel.
~45 min · ★★☆
Analyse critique — 4 chapitres¶
Forces, limites, niveau de preuve de chaque affirmation, questions ouvertes.
~45 min · ★★☆
Annexes — 5 pages¶
Glossaire, tableau complet des spécifications, vérification des paramètres pas à pas, chronologie, sources classées par fiabilité.
Référence
Avertissements méthodologiques¶
Trois précautions de lecture
1. Les benchmarks du tableau officiel sont mesurés par Qwen. Ce ne sont
pas des évaluations indépendantes. Six des trente et une lignes portent sur
des benchmarks dont Qwen est aussi l'auteur — QwenSWEBench,
QwenQoderBench, QwenReactBench, QwenSVGBench. Voir
Comprendre les benchmarks.
2. Aucune ablation n'est publiée. Rien ne permet d'attribuer les gains à l'architecture plutôt qu'aux données ou au post-entraînement. La formule « bâti sur la fondation architecturale de Qwen 3.5 » est la seule explication fournie.
3. Un même benchmark reçoit des scores contradictoires selon la source. Terminal-Bench 2.1 vaut 86,6 dans le tableau de Qwen ; d'autres relevés donnent 67,4. Ce rapport signale l'écart plutôt que de choisir. Voir Affirmations à vérifier.
Sources principales¶
| Source | Nature |
|---|---|
| huggingface.co/Qwen/Qwen3.8-2.4T-A95B | Poids, config.json, licence, carte de modèle — source primaire |
| qwen.ai/blog?id=qwen3.8 | Billet officiel — revendications, démonstrations |
| Communiqué Alibaba Group | Annonce institutionnelle du 3 août 2026 |
| Artificial Analysis | Évaluation indépendante — indice, vitesse, coût |
| Vals AI, LMArena | Évaluations indépendantes |
Liste complète et classée : Sources.
Voir aussi¶
- Qwen3.8-27B — le petit frère annoncé le même jour, publié le 14 août sous Apache 2.0 : dense, multimodal, 55,6 Go, et plus ouvert que le Max sur la licence, les modalités et le contrôle du raisonnement.
- Kimi K3 — le concurrent direct, 2,78 T de paramètres, publié deux semaines plus tôt et documenté par un vrai rapport technique.