Aller au contenu

Qu'est-ce qu'un grand modèle de langage

Tout ce que fait Qwen3.8-Max, à chaque instant, c'est prédire le morceau de texte suivant. Le reste en découle.


L'intuition

Vous tapez :

La capitale de la France est

Le modèle produit une liste de continuations possibles, chacune avec une probabilité :

Continuation Probabilité
Paris 0,94
située 0,02
la 0,01
… …

Il en choisit une, l'ajoute au texte, et recommence. C'est tout. Un modèle de langage n'est rien d'autre qu'une fonction qui, à partir d'un début de texte, donne une distribution de probabilités sur la suite.

Toutes les capacités observées — répondre à une question, écrire du code, raisonner en plusieurs étapes — sont des conséquences de cette prédiction répétée, pas des mécanismes séparés.

Pourquoi cela suffit

Pour prédire correctement la fin de « le résultat de la compilation était une erreur de type, causée par », il faut avoir modélisé quelque chose de la syntaxe, du typage et du raisonnement causal. La prédiction du texte suivant est une tâche qui, poussée assez loin, force l'apprentissage de tout ce qui aide à la réussir.


Les jetons, pas les mots

Le modèle ne voit pas des lettres, ni exactement des mots. Il voit des jetons (tokens) : des fragments de texte issus d'un découpage appris.

"internationalisation"  →  ["international", "isation"]
"Qwen3.8-Max"           →  ["Q", "wen", "3", ".", "8", "-", "Max"]
"是"                     →  ["是"]

Le vocabulaire est la liste complète des jetons connus. Pour Qwen3.8-Max, le fichier de configuration donne :

"vocab_size": 248320

Soit 248 320 jetons distincts. C'est un vocabulaire large — Llama 3 en utilise 128 000, Kimi K3 environ 160 000. Un grand vocabulaire découpe le texte en moins de morceaux, ce qui raccourcit les séquences et accélère le traitement, au prix d'une table d'embeddings plus lourde.

Erreur fréquente : jeton ≠ mot

En français, comptez environ 1,4 jeton par mot. Un contexte de 262 144 jetons représente donc à peu près 190 000 mots, soit deux gros romans. En chinois, le rapport est plus proche de 1 jeton par caractère.


Des jetons aux vecteurs

Un jeton est un numéro : Paris pourrait être le jeton n° 44 291. Un réseau de neurones ne travaille pas sur des numéros mais sur des vecteurs — des listes de nombres réels.

La table d'embeddings fait la conversion. C'est une matrice géante :

\[ E \in \mathbb{R}^{V \times H} \]
Symbole Signification Valeur pour Qwen3.8-Max
\(V\) taille du vocabulaire 248 320
\(H\) dimension cachée du modèle 8 192

Chaque ligne de \(E\) est le vecteur associé à un jeton : 8 192 nombres qui encodent, d'une manière apprise et non interprétable directement, ce que ce jeton « signifie » pour le modèle.

Le poids de cette seule table :

\[ 248\,320 \times 8\,192 = 2\,034\,237\,440 \approx 2{,}03 \text{ milliards de paramètres} \]

Deux milliards de paramètres rien que pour le dictionnaire, avant tout traitement.


Ce qu'est un paramètre

Un paramètre est un nombre réel ajusté pendant l'entraînement. Les paramètres sont l'intégralité de ce que le modèle a appris : effacez-les, il ne reste que du code inerte.

Quand on dit « Qwen3.8-Max a 2,4 billions de paramètres », on dit qu'il faut 2 400 milliards de nombres pour le décrire.

Ordres de grandeur

Modèle Paramètres Poids en BF16
Un modèle « petit » de 2026 4 G 8 Go
Qwen3.6-27B 27 G 54 Go
GPT-3 (2020) 175 G 350 Go
Qwen3.8-Max 2 420 G 4,89 To

Le facteur entre un modèle local et Qwen3.8-Max est d'environ 600.

En BF16 — le format standard, deux octets par nombre — 2,42 billions de paramètres pèsent 4,84 To. Le dépôt Hugging Face en affiche 4,89 : l'écart s'explique, et c'est l'objet de la vérification des paramètres.


Paramètres totaux et paramètres actifs

Voici la distinction qui structure tout le reste de ce rapport.

Dans un modèle dense classique, chaque paramètre participe au calcul de chaque jeton. 27 milliards de paramètres, c'est 27 milliards de multiplications par jeton (à peu près).

Dans un modèle creux (sparse), comme Qwen3.8-Max, une grande partie des paramètres est ignorée pour un jeton donné. Le modèle contient 2,42 billions de paramètres, mais n'en évalue que 95 milliards à chaque étape.

Total Actifs par jeton Ratio
Qwen3.8-Max 2,42 T 95,3 G 3,94 %

Les conséquences :

  • La mémoire dépend du total : il faut charger les 4,89 To.
  • La vitesse dépend de l'actif : le calcul est celui d'un modèle de 95 G.

C'est le compromis central du Mixture-of-Experts, traité au chapitre 04.

Erreur fréquente : « 2,4 T, donc lent »

Faux. Qwen3.8-Max calcule comme un modèle de 95 milliards de paramètres. Ce qui le rend coûteux, ce n'est pas le calcul, c'est la mémoire — il faut quand même stocker les 2,4 billions quelque part, et les 512 experts doivent être accessibles à tout instant.


Le mode raisonnement

Les modèles de 2026 produisent souvent, avant leur réponse, une longue suite de jetons de « réflexion » qui n'est pas montrée à l'utilisateur mais qui est générée — et facturée.

Qwen3.8-Max pousse cette idée loin :

  • le mode raisonnement est activé en permanence dans les poids ouverts, sans possibilité de le couper ;
  • le budget de raisonnement monte à 262 144 jetons ;
  • l'effort par défaut est réglé sur xhigh.

Concrètement, une question courte peut déclencher des dizaines de milliers de jetons invisibles. C'est la principale raison pour laquelle le modèle est mesuré à 47 jetons par seconde alors que le matériel en permettrait davantage, et pourquoi la facture réelle dépasse l'estimation naïve. Voir Coûts.


À retenir

Ce chapitre en cinq points

  1. Un modèle de langage prédit le jeton suivant, répétitivement.
  2. Le texte est découpé en jetons ; Qwen3.8-Max en connaît 248 320.
  3. Chaque jeton devient un vecteur de 8 192 nombres via la table d'embeddings, qui pèse à elle seule 2,03 milliards de paramètres.
  4. Un paramètre est un nombre appris. Le total détermine la mémoire, la part active détermine la vitesse.
  5. Qwen3.8-Max active 3,94 % de ses paramètres par jeton.

Chapitre suivant : Le Transformer et l'attention — comment le modèle relie un jeton à tous ceux qui le précèdent.