Aller au contenu

Glossaire

Les termes de ce rapport. Pour le vocabulaire architectural complet, voir le glossaire du rapport Qwen3.8-Max.


A

Actifs (paramètres) — Paramètres réellement évalués pour un jeton donné. Dans un modèle dense, ils égalent le total. Qwen3.8-27B étant dense, il active 100 % de ses 27,729 G à chaque jeton — contrairement au Max, qui n'en active que 3,94 %.

Apache 2.0 — Licence libre permissive, approuvée OSI, sans seuil ni condition. C'est celle de Qwen3.8-27B, alors que Qwen3.8-Max est sous licence maison.

Attention complète — Mécanisme classique où chaque jeton consulte tous les précédents. Coût \(O(n^2)\), et produit un cache clé-valeur. 16 couches sur 64 ici.

Attention hybride — Alternance de couches linéaires et complètes. Ratio 3:1 ici comme chez le Max : elle divise le cache par quatre.

Attention linéaire — Variante à état de taille fixe, coût \(O(n)\), sans cache clé-valeur. 48 couches sur 64 ici. → L'attention hybride


B

BF16 — Format sur 16 bits, 2 octets par paramètre. 55,46 Go pour ce modèle.


C

Cache clé-valeur — Stockage des clés et valeurs déjà calculées. Croît linéairement avec le contexte et la concurrence. Ici : 64 KiO par jeton, soit 17,18 Go au contexte natif — davantage que les poids en 4 bits. → Le coût du cache KV

config.json — Fichier de configuration livré avec les poids. Source unique de tout ce que ce rapport dit de l'architecture.

Contexte natif — Longueur sur laquelle le modèle a été entraîné ou adapté. 262 144 jetons — la même valeur que chez le prédécesseur et le grand frère.

Contexte étendu — Longueur atteinte par réinterprétation des positions à l'inférence. 1 000 000 jetons ici, via YaRN. Jamais mesuré par un benchmark.


D

Dense (modèle) — Modèle dont tous les paramètres participent à chaque jeton, par opposition au Mixture-of-Experts. C'est le cas ici : intermediate_size: 17408, aucun champ num_experts.

DeltaNet — Attention linéaire à règle delta : elle efface sélectivement l'ancienne association d'une clé avant d'écrire la nouvelle. 48 couches ici.


E

enable_thinking — Paramètre permettant de désactiver le mode raisonnement. Disponible ici, absent des poids du Max.

Encodeur visuel — Transformer de vision de 27 couches, 461 M de paramètres, qui convertit images et vidéo en jetons pour le modèle de langage. → La voie visuelle


F

FP8 — Format sur 8 bits. 27,73 Go ici. Minimum recommandé pour l'usage agentique. Une variante officielle existe.

full_attention_interval — Champ de config.json indiquant la périodicité des couches d'attention complète. Vaut 4 ici : une couche complète toutes les quatre.


G

GGUF — Format de fichier pour llama.cpp et Ollama. Disponible pour ce modèle dès le lendemain de sa publication.

GQA (Grouped Query Attention) — Plusieurs têtes de requête partagent un couple clé-valeur. Ratio 6:1 ici — 24 requêtes pour 4 clé-valeur.


M

mRoPE — Variante multimodale du RoPE, qui encode trois positions — temps, hauteur, largeur — sur des groupes de dimensions séparés. Sections [11, 11, 10] ici.

MoE (Mixture-of-Experts) — Architecture à experts dont quelques-uns seulement sont activés. Absent de ce modèle, présent chez le Max — un MoE de 27 G actifs ne tiendrait pas sur une carte.

ModelScope — Plateforme chinoise de distribution de modèles, équivalent de Hugging Face.

MTP (Multi-Token Prediction) — Couche prédisant plusieurs jetons en avant, pour un décodage spéculatif plus rapide. 372 M de paramètres ici.


N

NVFP4 / MXFP4 — Formats 4 bits à quantification par blocs, plus robustes qu'un INT4 naïf.


O

OSI (Open Source Initiative) — Organisation qui définit et approuve les licences libres. Apache 2.0 l'est ; la licence qwen3.8-max du grand frère ne l'est pas.


P

Poids ouverts — Poids téléchargeables. Ne dit rien de la licence : Qwen3.8-Max est en poids ouverts sous une licence à conditions, Qwen3.8-27B sous Apache 2.0.


Q

Q4_K_M — Quantification 4 bits par blocs du format GGUF. Le point d'entrée usuel pour l'exécution locale : 13,86 Go ici.

Quantification — Réduction du nombre de bits par paramètre. Ne réduit pas le cache, sauf à le quantifier séparément. → Quantification


R

reasoning_effort — Réglage de la profondeur de réflexion : low, medium, xhigh. En local, il détermine surtout le temps d'attente.

RoPE partiel — RoPE appliqué à une fraction des dimensions. 25 % ici, soit 64 des 256 dimensions de chaque tête.


S

SGLang / vLLM — Moteurs d'inférence recommandés. Tous deux supportent la quantification du cache clé-valeur.

SwiGLU — Réseau à trois matrices dont une branche module l'autre. Structure du réseau dense ici, de dimension 17 408.


V

VRAM — Mémoire d'un GPU. Le calcul complet est poids + cache + état + marge, jamais les poids seuls. → L'arithmétique de la VRAM


Y

YaRN — Méthode d'extension du contexte par réinterpolation des fréquences RoPE. Nommée explicitement par la carte de modèle pour l'extension à 1 000 000 de jetons — ses paramètres, eux, ne sont pas publiés.