Aller au contenu

Matériel

Ce que le modèle tient réellement sur votre carte — poids et cache.


Le problème que cette partie corrige

Depuis la publication, de nombreux sites publient un tableau de ce genre :

Précision VRAM requise Carte recommandée
BF16 ~55 Go classe 80 Go
FP8 ~28 Go classe 32 Go
4 bits ~14 Go classe 24 Go

Ces chiffres sont exacts. Ils sont aussi incomplets : ils ne comptent que les poids.

Le cache clé-valeur manque à l'appel

À 262 144 jetons de contexte natif :

Poste Taille
Poids en 4 bits 13,86 Go
Cache clé-valeur 17,18 Go

Le cache dépasse les poids. Une carte de 24 Go qui « fait tourner un 27 G en 4 bits » ne le fait tourner qu'à environ 115 600 jetons — soit 44 % de la fenêtre native, pas 100 %.

Mais la situation est bien meilleure qu'avec un modèle classique

Grâce à l'attention hybride, ce cache est quatre fois plus léger que celui d'un dense équivalent en attention complète — 17,18 Go au lieu de 68,72 Go.

C'est ce qui fait passer une RTX 4090 de ~31 000 à ~115 600 jetons utilisables.


Les trois chapitres

01 · L'arithmétique de la VRAM

Le calcul complet, et le tableau carte par carte pour les trois précisions.

~20 min · ★★★

02 · Le coût du cache clé-valeur

Pourquoi ce poste existe, comment il croît, et les leviers pour le réduire.

~15 min · ★★☆

03 · Quantification

Ce que chaque format coûte et ce qu'il abîme, et l'ordre d'optimisation à suivre.

~15 min · ★★☆


Le script

Toute cette partie est reproductible :

python3 verif-qwen3-8-27b.py

Le script est en Python pur, sans aucune dépendance. Il part du config.json publié, recalcule les 27,729 G de paramètres, retrouve la taille du dépôt à 0,26 % près, et produit tous les tableaux de cette partie.

Il ne lit rien en réseau

La configuration y est recopiée en dur, de sorte que le résultat reste reproductible même si le dépôt évolue. Il sort avec un code non nul si une vérification échoue.


Commencer : L'arithmétique de la VRAM.