Aller au contenu

Glossaire

Les termes du rapport, définis. Renvois vers le chapitre qui les développe.


A

Ablation — Expérience consistant à retirer ou modifier un composant pour mesurer sa contribution. Aucune n'est publiée pour Qwen3.8-Max.

Actifs (paramètres) — Paramètres réellement évalués pour un jeton donné. 95,29 G ici, soit 3,94 % du total. → Fondations 01

Attention — Mécanisme permettant à chaque jeton d'agréger l'information des jetons précédents, pondérée par la pertinence. → Fondations 02

Attention linéaire — Variante dont le coût croît en \(O(n)\) au lieu de \(O(n^2)\), en remplaçant la relecture de l'historique par un état de taille fixe. → Fondations 03

Autorégressif — Se dit d'un modèle qui génère un jeton à la fois, chacun conditionné par les précédents.


B

Bande passante mémoire — Débit auquel un GPU lit sa mémoire. Facteur limitant de la vitesse d'un grand MoE, avant la puissance de calcul. → Fondations 06

Benchmark — Ensemble standardisé de tâches servant à comparer des modèles. → Évaluations 01

BF16 (brain float 16) — Format sur 16 bits conservant la plage d'exposants de FP32. Format standard de publication des poids.


C

Cache clé-valeur (KV cache) — Stockage des clés et valeurs déjà calculées, pour éviter de les recalculer. 92 KiO par jeton ici. → Fondations 05

Cache de préfixe — Réutilisation d'un début de requête déjà traité. Divise le coût d'entrée par 8 à 12 chez Qwen. → Utilisation 03

Contamination — Présence d'un benchmark dans les données d'entraînement, qui rend son score non représentatif.

Contexte (fenêtre de) — Nombre maximal de jetons traitables en une fois. 262 144 natif, 1 010 000 étendu. → Architecture 06

Convolution causale — Convolution ne regardant que le passé. Noyau 4 dans les couches DeltaNet, pour une mémoire locale exacte.


D

Dense (modèle) — Modèle dont tous les paramètres participent à chaque jeton, par opposition à creux.

DeltaNet — Attention linéaire utilisant la règle delta : effacer sélectivement l'association liée à la clé courante avant d'écrire la nouvelle. → Architecture 02


E

Effort de raisonnement — Réglage contrôlant la longueur de la réflexion interne. xhigh par défaut ici, non désactivable dans les poids.

Embedding — Vecteur associé à un jeton. Dimension 8 192 ici.

Expert — Sous-réseau d'un MoE. 512 routés + 1 partagé, 50,33 M de paramètres chacun. → Architecture 04

Expert partagé — Expert traitant tous les jetons sans routage, qui absorbe les compétences communes.


F

FlashAttention — Famille d'algorithmes évitant de matérialiser la matrice d'attention \(n \times n\). Résout la mémoire, pas le coût quadratique de calcul.

FP8 — Format sur 8 bits. Divise la mémoire par deux par rapport à BF16.


G

GGUF — Format de fichier pour l'exécution via llama.cpp. Peu pertinent à l'échelle de 2,4 T.

GQA (Grouped Query Attention) — Plusieurs têtes de requête partagent un couple clé-valeur. Ratio 16:1 ici, ce qui divise le cache par 16. → Architecture 03


H

Harnais — Boucle qui donne des outils au modèle, gère les erreurs et décide de l'arrêt. Une source majeure d'incomparabilité entre benchmarks.

Hybride (attention) — Alternance de couches linéaires et complètes. 3:1 ici.


I

Indice d'intelligence — Composite publié par Artificial Analysis. 58 pour Qwen3.8-Max, 10ᵉ sur 184.


J

Jeton (token) — Fragment de texte, unité de traitement du modèle. Vocabulaire de 248 320 jetons ici. → Fondations 01


L

Licence qwen3.8-max — Licence maison des poids, non approuvée OSI, à seuils commerciaux. → Présentation 04


M

Masque causal — Interdiction faite à un jeton de regarder le futur.

MoE (Mixture-of-Experts) — Architecture remplaçant le réseau dense par plusieurs experts dont quelques-uns seulement sont activés. → Fondations 04

MTP (Multi-Token Prediction) — Couche prédisant plusieurs jetons en avant, au service du décodage spéculatif. ~26,2 G de paramètres ici. → Architecture 05


N

NVFP4 / MXFP4 — Formats 4 bits à quantification par blocs, plus robustes qu'un INT4 naïf.


P

Paramètre — Nombre réel appris pendant l'entraînement.

Porte (gate) — Multiplication par un facteur appris entre 0 et 1, permettant à un composant d'annuler sa propre sortie.

Préremplissage (prefill) — Traitement de l'invite avant la génération. Coût quadratique sur les couches d'attention complète.


Q

Quantification — Réduction du nombre de bits par paramètre. → Fondations 06


R

Règle delta — Mise à jour effaçant sélectivement l'ancienne association d'une clé avant d'écrire la nouvelle.

Résiduelle (connexion) — Ajout de l'entrée d'un bloc à sa sortie, qui permet d'empiler des dizaines de couches.

RoPE (Rotary Position Embedding) — Encodage de position par rotation des requêtes et des clés. Base \(10^7\) ici.

RoPE partiel — RoPE appliqué à une fraction des dimensions. 25 % ici. → Architecture 03

Routeur — Réseau choisissant quels experts activer. \(8\,192 \times 512\) ici, soit 4,19 M de paramètres.


S

Safetensors — Format de stockage de poids, sûr et rapide à charger. 213 fragments ici.

SGLang / vLLM — Moteurs d'inférence recommandés pour ce modèle.

Spéculative (génération) — Proposer plusieurs jetons d'un coup et les vérifier en une passe. Multiplie le débit sans changer les sorties.

SwiGLU — Réseau à trois matrices dont une branche module l'autre. Structure de chaque expert ici.


T

Tête (d'attention) — Sous-espace de l'attention. 64 têtes de requête, 4 clé-valeur, dimension 256 ici.

Transformer — Architecture de référence, empilement de blocs attention + réseau dense. → Fondations 02


V

Vocabulaire — Ensemble des jetons connus. 248 320 ici.


Y

YaRN — Méthode d'extension de contexte par réinterpolation des fréquences RoPE. Probablement utilisée ici, non confirmée.