Glossaire¶
Les termes du rapport, définis. Renvois vers le chapitre qui les développe.
A¶
Ablation — Expérience consistant à retirer ou modifier un composant pour mesurer sa contribution. Aucune n'est publiée pour Qwen3.8-Max.
Actifs (paramètres) — Paramètres réellement évalués pour un jeton donné. 95,29 G ici, soit 3,94 % du total. → Fondations 01
Attention — Mécanisme permettant à chaque jeton d'agréger l'information des jetons précédents, pondérée par la pertinence. → Fondations 02
Attention linéaire — Variante dont le coût croît en \(O(n)\) au lieu de \(O(n^2)\), en remplaçant la relecture de l'historique par un état de taille fixe. → Fondations 03
Autorégressif — Se dit d'un modèle qui génère un jeton à la fois, chacun conditionné par les précédents.
B¶
Bande passante mémoire — Débit auquel un GPU lit sa mémoire. Facteur limitant de la vitesse d'un grand MoE, avant la puissance de calcul. → Fondations 06
Benchmark — Ensemble standardisé de tâches servant à comparer des modèles. → Évaluations 01
BF16 (brain float 16) — Format sur 16 bits conservant la plage d'exposants de FP32. Format standard de publication des poids.
C¶
Cache clé-valeur (KV cache) — Stockage des clés et valeurs déjà calculées, pour éviter de les recalculer. 92 KiO par jeton ici. → Fondations 05
Cache de préfixe — Réutilisation d'un début de requête déjà traité. Divise le coût d'entrée par 8 à 12 chez Qwen. → Utilisation 03
Contamination — Présence d'un benchmark dans les données d'entraînement, qui rend son score non représentatif.
Contexte (fenêtre de) — Nombre maximal de jetons traitables en une fois. 262 144 natif, 1 010 000 étendu. → Architecture 06
Convolution causale — Convolution ne regardant que le passé. Noyau 4 dans les couches DeltaNet, pour une mémoire locale exacte.
D¶
Dense (modèle) — Modèle dont tous les paramètres participent à chaque jeton, par opposition à creux.
DeltaNet — Attention linéaire utilisant la règle delta : effacer sélectivement l'association liée à la clé courante avant d'écrire la nouvelle. → Architecture 02
E¶
Effort de raisonnement — Réglage contrôlant la longueur de la réflexion
interne. xhigh par défaut ici, non désactivable dans les poids.
Embedding — Vecteur associé à un jeton. Dimension 8 192 ici.
Expert — Sous-réseau d'un MoE. 512 routés + 1 partagé, 50,33 M de paramètres chacun. → Architecture 04
Expert partagé — Expert traitant tous les jetons sans routage, qui absorbe les compétences communes.
F¶
FlashAttention — Famille d'algorithmes évitant de matérialiser la matrice d'attention \(n \times n\). Résout la mémoire, pas le coût quadratique de calcul.
FP8 — Format sur 8 bits. Divise la mémoire par deux par rapport à BF16.
G¶
GGUF — Format de fichier pour l'exécution via llama.cpp. Peu pertinent à
l'échelle de 2,4 T.
GQA (Grouped Query Attention) — Plusieurs têtes de requête partagent un couple clé-valeur. Ratio 16:1 ici, ce qui divise le cache par 16. → Architecture 03
H¶
Harnais — Boucle qui donne des outils au modèle, gère les erreurs et décide de l'arrêt. Une source majeure d'incomparabilité entre benchmarks.
Hybride (attention) — Alternance de couches linéaires et complètes. 3:1 ici.
I¶
Indice d'intelligence — Composite publié par Artificial Analysis. 58 pour Qwen3.8-Max, 10ᵉ sur 184.
J¶
Jeton (token) — Fragment de texte, unité de traitement du modèle. Vocabulaire de 248 320 jetons ici. → Fondations 01
L¶
Licence qwen3.8-max — Licence maison des poids, non approuvée OSI, à
seuils commerciaux.
→ Présentation 04
M¶
Masque causal — Interdiction faite à un jeton de regarder le futur.
MoE (Mixture-of-Experts) — Architecture remplaçant le réseau dense par plusieurs experts dont quelques-uns seulement sont activés. → Fondations 04
MTP (Multi-Token Prediction) — Couche prédisant plusieurs jetons en avant, au service du décodage spéculatif. ~26,2 G de paramètres ici. → Architecture 05
N¶
NVFP4 / MXFP4 — Formats 4 bits à quantification par blocs, plus robustes qu'un INT4 naïf.
P¶
Paramètre — Nombre réel appris pendant l'entraînement.
Porte (gate) — Multiplication par un facteur appris entre 0 et 1, permettant à un composant d'annuler sa propre sortie.
Préremplissage (prefill) — Traitement de l'invite avant la génération. Coût quadratique sur les couches d'attention complète.
Q¶
Quantification — Réduction du nombre de bits par paramètre. → Fondations 06
R¶
Règle delta — Mise à jour effaçant sélectivement l'ancienne association d'une clé avant d'écrire la nouvelle.
Résiduelle (connexion) — Ajout de l'entrée d'un bloc à sa sortie, qui permet d'empiler des dizaines de couches.
RoPE (Rotary Position Embedding) — Encodage de position par rotation des requêtes et des clés. Base \(10^7\) ici.
RoPE partiel — RoPE appliqué à une fraction des dimensions. 25 % ici. → Architecture 03
Routeur — Réseau choisissant quels experts activer. \(8\,192 \times 512\) ici, soit 4,19 M de paramètres.
S¶
Safetensors — Format de stockage de poids, sûr et rapide à charger. 213 fragments ici.
SGLang / vLLM — Moteurs d'inférence recommandés pour ce modèle.
Spéculative (génération) — Proposer plusieurs jetons d'un coup et les vérifier en une passe. Multiplie le débit sans changer les sorties.
SwiGLU — Réseau à trois matrices dont une branche module l'autre. Structure de chaque expert ici.
T¶
Tête (d'attention) — Sous-espace de l'attention. 64 têtes de requête, 4 clé-valeur, dimension 256 ici.
Transformer — Architecture de référence, empilement de blocs attention + réseau dense. → Fondations 02
V¶
Vocabulaire — Ensemble des jetons connus. 248 320 ici.
Y¶
YaRN — Méthode d'extension de contexte par réinterpolation des fréquences RoPE. Probablement utilisée ici, non confirmée.