Matériel¶
Ce que le modèle tient réellement sur votre carte — poids et cache.
Le problème que cette partie corrige¶
Depuis la publication, de nombreux sites publient un tableau de ce genre :
| Précision | VRAM requise | Carte recommandée |
|---|---|---|
| BF16 | ~55 Go | classe 80 Go |
| FP8 | ~28 Go | classe 32 Go |
| 4 bits | ~14 Go | classe 24 Go |
Ces chiffres sont exacts. Ils sont aussi incomplets : ils ne comptent que les poids.
Le cache clé-valeur manque à l'appel
À 262 144 jetons de contexte natif :
| Poste | Taille |
|---|---|
| Poids en 4 bits | 13,86 Go |
| Cache clé-valeur | 17,18 Go |
Le cache dépasse les poids. Une carte de 24 Go qui « fait tourner un 27 G en 4 bits » ne le fait tourner qu'à environ 115 600 jetons — soit 44 % de la fenêtre native, pas 100 %.
Mais la situation est bien meilleure qu'avec un modèle classique
Grâce à l'attention hybride, ce cache est quatre fois plus léger que celui d'un dense équivalent en attention complète — 17,18 Go au lieu de 68,72 Go.
C'est ce qui fait passer une RTX 4090 de ~31 000 à ~115 600 jetons utilisables.
Les trois chapitres¶
01 · L'arithmétique de la VRAM¶
Le calcul complet, et le tableau carte par carte pour les trois précisions.
~20 min · ★★★
02 · Le coût du cache clé-valeur¶
Pourquoi ce poste existe, comment il croît, et les leviers pour le réduire.
~15 min · ★★☆
03 · Quantification¶
Ce que chaque format coûte et ce qu'il abîme, et l'ordre d'optimisation à suivre.
~15 min · ★★☆
Le script¶
Toute cette partie est reproductible :
python3 verif-qwen3-8-27b.py
Le script est en Python pur, sans aucune
dépendance. Il part du config.json publié, recalcule les 27,729 G de
paramètres, retrouve la taille du dépôt à 0,26 % près, et produit tous les
tableaux de cette partie.
Il ne lit rien en réseau
La configuration y est recopiée en dur, de sorte que le résultat reste reproductible même si le dépôt évolue. Il sort avec un code non nul si une vérification échoue.
Commencer : L'arithmétique de la VRAM.