Fiche technique
Tout ce qui est établi sur Qwen3.8-Max, avec la source de chaque ligne.
Chaque ligne porte l'origine de son information :
| Marque |
Signification |
config |
lu directement dans config.json |
carte |
carte de modèle Hugging Face |
dépôt |
observé sur le dépôt (taille, fichiers) |
calcul |
recalculé par le script joint |
annonce |
communiqué ou billet officiel, non vérifié indépendamment |
Identité
| Champ |
Valeur |
Source |
| Nom commercial |
Qwen3.8-Max |
annonce |
| Nom du dépôt |
Qwen/Qwen3.8-2.4T-A95B |
dépôt |
| Éditeur |
Qwen Team, Alibaba Group |
annonce |
| Annonce |
3 août 2026 |
annonce |
| Publication des poids |
12 août 2026 |
dépôt |
| Classe d'architecture |
Qwen3_5MoeForCausalLM |
config |
| Type de modèle |
qwen3_5_moe_text |
config |
Le nom de classe est instructif
Qwen3_5MoeForCausalLM confirme, sans ambiguïté, la formule du communiqué :
le modèle réutilise le code d'architecture de Qwen3.5. Ce n'est pas une
nouvelle famille, c'est une montée en échelle de la précédente.
Le suffixe _text du model_type confirme de son côté l'absence de voie
visuelle dans les poids publiés.
Dimensions
| Champ |
Valeur |
Source |
| Paramètres totaux |
2,4198 T (2,4460 T avec MTP) |
calcul |
| Paramètres annoncés |
2,4 T |
annonce |
| Paramètres actifs / jeton |
95,29 G |
calcul |
| Actifs annoncés |
95 G |
annonce |
| Part activée |
3,94 % |
calcul |
| Couches |
92 |
config |
| Dimension cachée |
8 192 |
config |
| Vocabulaire |
248 320 |
config |
| Embeddings liés à la tête ? |
non (tie_word_embeddings: false) |
config |
| Table d'embeddings |
2,034 G de paramètres |
calcul |
Attention
| Champ |
Valeur |
Source |
| Motif |
23 × (3 × linéaire + 1 × complète) |
config, carte |
| Couches d'attention linéaire |
69 |
calcul |
| Couches d'attention complète |
23 |
calcul |
| Intervalle d'attention complète |
4 |
config |
Attention complète (gatée)
| Champ |
Valeur |
Source |
| Têtes de requête |
64 |
config |
| Têtes clé-valeur |
4 (GQA, ratio 16:1) |
config |
| Dimension de tête |
256 |
config |
| Porte de sortie |
activée (attn_output_gate: true) |
config |
| RoPE partiel |
0,25 — soit 64 des 256 dimensions |
config |
| Base RoPE (\(\theta\)) |
10 000 000 |
config |
| Biais d'attention |
aucun |
config |
| Paramètres par couche |
419,4 M |
calcul |
Attention linéaire (Gated DeltaNet)
| Champ |
Valeur |
Source |
| Têtes de valeur |
128 |
config |
| Têtes de clé |
16 |
config |
| Dimension de tête (clé) |
128 |
config |
| Dimension de tête (valeur) |
128 |
config |
| Noyau de convolution causale |
4 |
config |
| Type de porte de sortie |
swish |
config |
| Précision de l'état récurrent |
float32 |
config |
| Paramètres par couche |
438,4 M |
calcul |
Mixture-of-Experts
| Champ |
Valeur |
Source |
| Experts routés |
512 |
config |
| Experts actifs par jeton |
10 |
config |
| Expert partagé |
1, toujours actif |
config |
| Dimension intermédiaire d'un expert |
2 048 |
config |
| Dimension de l'expert partagé |
2 048 |
config |
| Paramètres par expert |
50,33 M |
calcul |
| Paramètres du bloc MoE par couche |
25,82 G |
calcul |
| Part du modèle en blocs MoE |
98,2 % |
calcul |
| Coefficient de perte d'équilibrage |
0,001 |
config |
| Activation |
SiLU / SwiGLU |
config |
Contexte
| Champ |
Valeur |
Source |
| Contexte natif |
262 144 jetons |
config |
| Contexte étendu |
1 010 000 jetons |
carte |
| Méthode d'extension |
non précisée |
— |
| Cache KV par jeton |
92 KiO |
calcul |
| Cache KV à 262 144 jetons |
24,7 Go |
calcul |
| Cache KV à 1 010 000 jetons |
95,2 Go |
calcul |
| État récurrent (constant) |
0,58 Go |
calcul |
Décodage et service
| Champ |
Valeur |
Source |
| Couches de prédiction multi-jetons |
1 |
config |
| Embeddings MTP dédiés |
non |
config |
| Sortie maximale |
131 072 jetons |
annonce |
| Budget de raisonnement |
jusqu'à 262 144 jetons |
annonce |
| Mode raisonnement |
forcé, non désactivable (poids) |
carte |
| Effort par défaut |
xhigh |
carte |
| Échantillonnage recommandé |
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0 |
carte |
| Moteurs recommandés |
SGLang, vLLM, TokenSpeed |
carte |
Le dépôt
| Champ |
Valeur |
Source |
| Format des poids |
safetensors, BF16 |
dépôt |
| Fragments |
213 |
dépôt |
| Taille totale |
4,89 To |
dépôt |
| Taille recalculée en BF16 |
4,89 To |
calcul |
| Variante officielle |
Qwen3.8-2.4T-A95B-FP8 |
dépôt |
| Licence |
qwen3.8-max |
dépôt |
| Modalités |
texte uniquement |
carte |
Tarifs de l'API
| Poste |
Tarif par million de jetons |
Source |
| Entrée |
2,00 $ |
annonce |
| Sortie |
6,00 $ |
annonce |
| Cache implicite (lecture) |
0,25 $ |
annonce |
| Cache explicite (création) |
2,50 $ |
annonce |
| Cache explicite (lecture) |
0,17 $ |
annonce |
| Limite de débit |
2 M jetons/min, 15 k requêtes/min |
annonce |
Ce qui n'est pas publié
Liste explicite, pour éviter que l'absence passe pour de l'oubli :
- la recette d'entraînement : nombre de jetons, mélange de données, durée,
matériel ;
- toute ablation justifiant le ratio 3:1 ou le nombre d'experts ;
- la méthode d'extension du contexte à 1 010 000 jetons ;
- la méthode de post-entraînement : SFT, apprentissage par renforcement,
distillation ;
- les évaluations de sécurité ;
- la consommation énergétique et l'empreinte carbone ;
- le modèle de base (non affiné) — seule la version instruite est publiée.
Voir Questions ouvertes.
Chapitre suivant : Licence et disponibilité
— le chapitre à lire avant tout engagement.