Aller au contenu

Tableau des spécifications

Toutes les valeurs numériques du rapport, en un endroit.

Légende des sources : config = config.json · carte = carte de modèle · dépôt = observé · calcul = script joint · annonce = communiqué · tiers = évaluateur indépendant.


Identité

Champ Valeur Source
Nom commercial Qwen3.8-Max annonce
Dépôt Qwen/Qwen3.8-2.4T-A95B dépôt
Éditeur Qwen Team, Alibaba Group annonce
Annoncé le 3 août 2026 annonce
Poids publiés le 12 août 2026 dépôt
Classe Qwen3_5MoeForCausalLM config
Type qwen3_5_moe_text config
Licence qwen3.8-max dépôt

Paramètres

Champ Valeur Source
Total (corps) 2 419 802 390 528 calcul
Total avec MTP 2 446 046 151 168 calcul
Total annoncé 2,4 T annonce
Actifs (embeddings inclus) 95 287 095 424 calcul
Actifs (hors embeddings) 93 252 857 984 calcul
Actifs annoncés 95 G annonce
Part activée 3,94 % calcul
Part en blocs MoE 98,18 % calcul

Structure

Champ Valeur Source
Couches 92 config
Couches linéaires 69 calcul
Couches complètes 23 calcul
Intervalle d'attention complète 4 config
Dimension cachée 8 192 config
Vocabulaire 248 320 config
Embeddings liés non config
Couches MTP 1 config
Embeddings MTP dédiés non config
Activation SiLU config
\(\varepsilon\) de RMSNorm 1e-06 config

Attention complète

Champ Valeur Source
Têtes de requête 64 config
Têtes clé-valeur 4 config
Ratio GQA 16:1 calcul
Dimension de tête 256 config
Porte de sortie oui config
Facteur RoPE partiel 0,25 config
Base RoPE 10 000 000 config
Biais non config
Paramètres par couche 419 430 912 calcul
Total sur 23 couches 9,65 G calcul

Attention linéaire

Champ Valeur Source
Têtes de valeur 128 config
Têtes de clé 16 config
Dimension de tête clé 128 config
Dimension de tête valeur 128 config
Dimension q/k totale 2 048 calcul
Dimension v totale 16 384 calcul
Noyau de convolution 4 config
Type de porte swish config
Précision de l'état float32 config
Paramètres par couche 438 386 816 calcul
Total sur 69 couches 30,25 G calcul

Mixture-of-Experts

Champ Valeur Source
Experts routés 512 config
Actifs par jeton 10 config
Expert partagé 1 config
Dimension intermédiaire 2 048 config
Paramètres par expert 50 331 648 calcul
Paramètres du routeur 4 194 304 calcul
Bloc MoE par couche 25 824 329 728 calcul
Total sur 92 couches 2 375,84 G calcul
Actifs par couche 557 842 432 calcul
Coefficient d'équilibrage 0,001 config
Facteur stockage / calcul 46,3 calcul

Contexte et mémoire

Champ Valeur Source
Contexte natif 262 144 config
Contexte étendu 1 010 000 carte
Entrée maximale (API) 991 000 annonce
Entrée max. avec raisonnement 983 000 annonce
Sortie maximale 131 072 annonce
Budget de raisonnement 262 144 annonce
Cache KV par jeton 94 208 octets (92 KiO) calcul
Cache à 32 768 jetons 3,09 Go calcul
Cache à 262 144 jetons 24,7 Go calcul
Cache à 1 010 000 jetons 95,2 Go calcul
Cache si 92 couches complètes, à 1 M 380,6 Go calcul
Économie de l'hybride 75 % calcul
État récurrent (constant) 0,58 Go calcul

Le dépôt

Champ Valeur Source
Fragments safetensors 213 dépôt
Taille totale 4,89 To dépôt
Taille recalculée BF16 4,892 To calcul
Précision BF16 config
Modalités texte seul carte
Raisonnement désactivable non carte

Matériel (contexte plein, 85 % de VRAM utile)

Précision Total mémoire H100 80 Go B200 180 Go Source
BF16 4 988 Go 74 33 calcul
FP8 2 542 Go 38 17 calcul
4 bits 1 319 Go 20 9 calcul

Tarifs (par million de jetons)

Poste Tarif Source
Entrée 2,00 $ annonce
Sortie 6,00 $ annonce
Cache implicite (lecture) 0,25 $ annonce
Cache explicite (création) 2,50 $ annonce
Cache explicite (lecture) 0,17 $ annonce
Prix mélangé (7:2:1) 1,18 $ tiers
Coût par tâche 1,13 $ tiers
Limite de débit 2 M jetons/min · 15 k req/min annonce

Performance mesurée

Mesure Valeur Rang Source
Indice d'intelligence 58 10ᵉ / 184 tiers
Vitesse de sortie 47,0 jetons/s 119ᵉ / 184 tiers
Délai au premier jeton 2,72 s — tiers
Coût par tâche 1,13 $ 58ᵉ / 184 tiers
Vals Index 66,1 % 2ᵉ des ouverts tiers
LMArena Text — 5ᵉ tiers
LMArena Vision (API) 1 305 2ᵉ tiers
LMArena Frontend Code 1 668 Elo 4ᵉ tiers

Échantillonnage recommandé

Paramètre Valeur Source
temperature 1,0 carte
top_p 0,95 carte
top_k 20 carte
min_p 0,0 carte
reasoning_effort par défaut xhigh carte