Annexes¶
Quatre pages de référence, et le script.
Les pages¶
Glossaire¶
Les termes utilisés dans ce rapport. Pour le vocabulaire architectural détaillé, le glossaire du rapport Qwen3.8-Max est plus complet.
Tableau des spécifications¶
Toutes les valeurs numériques du rapport en un seul endroit, avec leur source. C'est la page à copier si vous devez citer un chiffre.
Vérification des paramètres et de la VRAM¶
Le décompte complet, pas à pas, depuis config.json jusqu'aux 27,729 G — et la
vérification par la taille du dépôt à 0,26 % près.
Sources¶
Toutes les références, classées par fiabilité, avec ce que chacune soutient.
Le script¶
verif-qwen3-8-27b.py — Python pur, sans
dépendance.
python3 verif-qwen3-8-27b.py
Sortie attendue :
[OK ] total vs étiquette « 28B » écart 0.97 %
[OK ] taille du dépôt vs 55,6 Go écart 0.26 %
Il reconstruit les paramètres depuis le config.json publié, calcule le cache
clé-valeur, le contrefactuel sans attention hybride, et le contexte tenable par
carte pour les trois précisions.
Il ne lit rien en réseau
La configuration y est recopiée en dur, de sorte que le résultat reste reproductible même si le dépôt évolue. Il sort avec un code non nul si une vérification échoue.
Une note sur son histoire
La première version de ce script, écrite avant la publication du modèle, calculait des bornes sous trois hypothèses d'architecture.
Le scénario qui s'est réalisé était l'un des deux jugés possibles, et ses chiffres de cache se sont vérifiés exactement — pour des raisons en partie fortuites. Voir Le verdict des hypothèses.
Voir aussi¶
Pour le cours d'entrée sur les notions utilisées ici — attention linéaire, DeltaNet, cache clé-valeur, quantification — le rapport sur le grand frère est la référence :