Aller au contenu

Qwen3.8-Max : analyse complète

Le premier modèle de classe « Max » dont Alibaba publie les poids — 2,4 billions de paramètres, et un fichier de configuration qui en dit plus que le communiqué.


Ce que contient cette recherche

Une analyse de Qwen3.8-Max, annoncé le 3 août 2026 par l'équipe Qwen d'Alibaba et publié en poids ouverts le 12 août 2026 sous le nom Qwen/Qwen3.8-2.4T-A95B.

Ce rapport a une particularité méthodologique qu'il faut poser d'emblée :

Il n'existe aucun rapport technique

Contrairement à Kimi K3, qui s'accompagne d'un document de 80 pages sur arXiv, Qwen3.8-Max n'a ni papier, ni rapport technique, ni description d'entraînement. Le communiqué officiel se contente de la formule « built upon the architectural foundation of Qwen 3.5 » et d'un « hybrid attention mechanism ».

Tout ce que l'on sait de précis sur l'architecture vient donc d'une seule source : le fichier config.json livré avec les poids. Ce rapport le lit ligne par ligne, et recalcule tout ce qui peut l'être.

Objectif Comprendre l'architecture réelle du modèle, vérifier les chiffres annoncés, et savoir ce que l'on peut ou non en faire
Public Toute personne curieuse des grands modèles de langage — aucun prérequis
Prérequis Aucun. La partie Fondations construit le vocabulaire
Volume 8 parties, 33 chapitres
Temps de lecture 5 à 7 h pour l'intégralité · 20 min pour le résumé exécutif
Difficulté Progressive : ★☆☆ (Fondations) → ★★★★ (Architecture)
Créé le 13 août 2026
Dernière révision 15 août 2026

Qwen3.8-Max en une phrase

Un Mixture-of-Experts de 2,42 billions de paramètres dont 95 milliards sont actifs par jeton, bâti sur une alternance 3 couches d'attention linéaire pour 1 couche d'attention complète, avec un contexte natif de 262 144 jetons extensible à 1 010 000, publié sous une licence maison — et sans les capacités visuelles de la version API.


Ce que cette recherche apporte de plus que le communiqué

Des vérifications indépendantes, toutes reproductibles

Un script en Python pur, sans aucune dépendance, part du seul config.json et reconstruit les chiffres annoncés :

Vérification Calculé Annoncé / observé Écart
Paramètres totaux 2,4198 T 2,4 T 0,83 %
Paramètres actifs par jeton 95,29 G 95 G 0,30 %
Taille du dépôt en BF16 4,89 To 4,89 To 0,04 %

La troisième ligne n'est pas une coïncidence : elle établit que la couche de prédiction multi-jetons est bel et bien dans les poids livrés, ce que la carte de modèle ne dit nulle part. Voir Vérification des paramètres.

Deux résultats que la presse n'a pas relevés

  1. Le modèle téléchargeable n'est pas le modèle de l'API. Les poids ouverts sont exclusivement textuels, et le mode raisonnement y est impossible à désactiver. La version API, elle, accepte images et vidéos. Les scores de « Vision Arena » ne concernent donc pas le fichier que vous téléchargez. Voir Licence et disponibilité.

  2. L'attention hybride divise par quatre le coût du contexte long. À 1 010 000 jetons, le cache clé-valeur pèse 95 Go au lieu des 381 Go qu'exigerait la même architecture en attention complète — le chiffre n'est publié nulle part, il se déduit de config.json. Voir Contexte 262 K et 1 M.


Par où commencer

Vous êtes… Commencez par
Pressé Résumé exécutif — 20 minutes
Débutant complet Fondations, dans l'ordre
Familier des LLM Architecture · Vue d'ensemble
Vous voulez l'utiliser Utilisation
Vous voulez juger Analyse critique

Le chapitre Parcours de lecture détaille chaque itinéraire.


Les huit parties

Fondations — 6 chapitres

Le cours d'entrée : jetons, Transformer et attention, attention linéaire et DeltaNet, Mixture-of-Experts, cache clé-valeur, quantification et matériel.

Aucun prérequis · ~2 h · ★☆☆

Présentation — 4 chapitres

Alibaba et la lignée Qwen, ce que l'annonce affirme, la fiche technique complète, la licence maison et ses conditions.

~45 min · ★☆☆

Architecture — 6 chapitres

Le cœur du rapport. L'alternance 3:1, Gated DeltaNet, l'attention complète gatée, le MoE à 513 experts, la prédiction multi-jetons, l'arithmétique du contexte long — avec les formules et leur explication.

~1 h 30 · ★★★★

Évaluations — 4 chapitres

Le tableau officiel de 31 lignes reproduit intégralement, les évaluations indépendantes, les démonstrations agentiques, et ce qu'il faut en penser.

~1 h · ★★☆

Utilisation — 3 chapitres

Par l'API, ou en exécutant les poids — avec le décompte honnête du matériel nécessaire. Et le calcul du coût réel.

~45 min · ★★☆

Analyse critique — 4 chapitres

Forces, limites, niveau de preuve de chaque affirmation, questions ouvertes.

~45 min · ★★☆

Annexes — 5 pages

Glossaire, tableau complet des spécifications, vérification des paramètres pas à pas, chronologie, sources classées par fiabilité.

Référence


Avertissements méthodologiques

Trois précautions de lecture

1. Les benchmarks du tableau officiel sont mesurés par Qwen. Ce ne sont pas des évaluations indépendantes. Six des trente et une lignes portent sur des benchmarks dont Qwen est aussi l'auteur — QwenSWEBench, QwenQoderBench, QwenReactBench, QwenSVGBench. Voir Comprendre les benchmarks.

2. Aucune ablation n'est publiée. Rien ne permet d'attribuer les gains à l'architecture plutôt qu'aux données ou au post-entraînement. La formule « bâti sur la fondation architecturale de Qwen 3.5 » est la seule explication fournie.

3. Un même benchmark reçoit des scores contradictoires selon la source. Terminal-Bench 2.1 vaut 86,6 dans le tableau de Qwen ; d'autres relevés donnent 67,4. Ce rapport signale l'écart plutôt que de choisir. Voir Affirmations à vérifier.


Sources principales

Source Nature
huggingface.co/Qwen/Qwen3.8-2.4T-A95B Poids, config.json, licence, carte de modèle — source primaire
qwen.ai/blog?id=qwen3.8 Billet officiel — revendications, démonstrations
Communiqué Alibaba Group Annonce institutionnelle du 3 août 2026
Artificial Analysis Évaluation indépendante — indice, vitesse, coût
Vals AI, LMArena Évaluations indépendantes

Liste complète et classée : Sources.


Voir aussi

  • Qwen3.8-27B — le petit frère annoncé le même jour, publié le 14 août sous Apache 2.0 : dense, multimodal, 55,6 Go, et plus ouvert que le Max sur la licence, les modalités et le contrôle du raisonnement.
  • Kimi K3 — le concurrent direct, 2,78 T de paramètres, publié deux semaines plus tôt et documenté par un vrai rapport technique.