Aller au contenu

Fiche technique

Tout ce qui est établi sur Qwen3.8-Max, avec la source de chaque ligne.


Comment lire ce tableau

Chaque ligne porte l'origine de son information :

Marque Signification
config lu directement dans config.json
carte carte de modèle Hugging Face
dépôt observé sur le dépôt (taille, fichiers)
calcul recalculé par le script joint
annonce communiqué ou billet officiel, non vérifié indépendamment

Identité

Champ Valeur Source
Nom commercial Qwen3.8-Max annonce
Nom du dépôt Qwen/Qwen3.8-2.4T-A95B dépôt
Éditeur Qwen Team, Alibaba Group annonce
Annonce 3 août 2026 annonce
Publication des poids 12 août 2026 dépôt
Classe d'architecture Qwen3_5MoeForCausalLM config
Type de modèle qwen3_5_moe_text config

Le nom de classe est instructif

Qwen3_5MoeForCausalLM confirme, sans ambiguïté, la formule du communiqué : le modèle réutilise le code d'architecture de Qwen3.5. Ce n'est pas une nouvelle famille, c'est une montée en échelle de la précédente.

Le suffixe _text du model_type confirme de son côté l'absence de voie visuelle dans les poids publiés.


Dimensions

Champ Valeur Source
Paramètres totaux 2,4198 T (2,4460 T avec MTP) calcul
Paramètres annoncés 2,4 T annonce
Paramètres actifs / jeton 95,29 G calcul
Actifs annoncés 95 G annonce
Part activée 3,94 % calcul
Couches 92 config
Dimension cachée 8 192 config
Vocabulaire 248 320 config
Embeddings liés à la tête ? non (tie_word_embeddings: false) config
Table d'embeddings 2,034 G de paramètres calcul

Attention

Champ Valeur Source
Motif 23 × (3 × linéaire + 1 × complète) config, carte
Couches d'attention linéaire 69 calcul
Couches d'attention complète 23 calcul
Intervalle d'attention complète 4 config

Attention complète (gatée)

Champ Valeur Source
Têtes de requête 64 config
Têtes clé-valeur 4 (GQA, ratio 16:1) config
Dimension de tête 256 config
Porte de sortie activée (attn_output_gate: true) config
RoPE partiel 0,25 — soit 64 des 256 dimensions config
Base RoPE (\(\theta\)) 10 000 000 config
Biais d'attention aucun config
Paramètres par couche 419,4 M calcul

Attention linéaire (Gated DeltaNet)

Champ Valeur Source
Têtes de valeur 128 config
Têtes de clé 16 config
Dimension de tête (clé) 128 config
Dimension de tête (valeur) 128 config
Noyau de convolution causale 4 config
Type de porte de sortie swish config
Précision de l'état récurrent float32 config
Paramètres par couche 438,4 M calcul

Mixture-of-Experts

Champ Valeur Source
Experts routés 512 config
Experts actifs par jeton 10 config
Expert partagé 1, toujours actif config
Dimension intermédiaire d'un expert 2 048 config
Dimension de l'expert partagé 2 048 config
Paramètres par expert 50,33 M calcul
Paramètres du bloc MoE par couche 25,82 G calcul
Part du modèle en blocs MoE 98,2 % calcul
Coefficient de perte d'équilibrage 0,001 config
Activation SiLU / SwiGLU config

Contexte

Champ Valeur Source
Contexte natif 262 144 jetons config
Contexte étendu 1 010 000 jetons carte
Méthode d'extension non précisée —
Cache KV par jeton 92 KiO calcul
Cache KV à 262 144 jetons 24,7 Go calcul
Cache KV à 1 010 000 jetons 95,2 Go calcul
État récurrent (constant) 0,58 Go calcul

Décodage et service

Champ Valeur Source
Couches de prédiction multi-jetons 1 config
Embeddings MTP dédiés non config
Sortie maximale 131 072 jetons annonce
Budget de raisonnement jusqu'à 262 144 jetons annonce
Mode raisonnement forcé, non désactivable (poids) carte
Effort par défaut xhigh carte
Échantillonnage recommandé temperature=1.0, top_p=0.95, top_k=20, min_p=0.0 carte
Moteurs recommandés SGLang, vLLM, TokenSpeed carte

Le dépôt

Champ Valeur Source
Format des poids safetensors, BF16 dépôt
Fragments 213 dépôt
Taille totale 4,89 To dépôt
Taille recalculée en BF16 4,89 To calcul
Variante officielle Qwen3.8-2.4T-A95B-FP8 dépôt
Licence qwen3.8-max dépôt
Modalités texte uniquement carte

Tarifs de l'API

Poste Tarif par million de jetons Source
Entrée 2,00 $ annonce
Sortie 6,00 $ annonce
Cache implicite (lecture) 0,25 $ annonce
Cache explicite (création) 2,50 $ annonce
Cache explicite (lecture) 0,17 $ annonce
Limite de débit 2 M jetons/min, 15 k requêtes/min annonce

Ce qui n'est pas publié

Liste explicite, pour éviter que l'absence passe pour de l'oubli :

  • la recette d'entraînement : nombre de jetons, mélange de données, durée, matériel ;
  • toute ablation justifiant le ratio 3:1 ou le nombre d'experts ;
  • la méthode d'extension du contexte à 1 010 000 jetons ;
  • la méthode de post-entraînement : SFT, apprentissage par renforcement, distillation ;
  • les évaluations de sécurité ;
  • la consommation énergétique et l'empreinte carbone ;
  • le modèle de base (non affiné) — seule la version instruite est publiée.

Voir Questions ouvertes.


Chapitre suivant : Licence et disponibilité — le chapitre à lire avant tout engagement.