Aller au contenu

Annexes

Quatre pages de référence, et le script.


Les pages

Glossaire

Les termes utilisés dans ce rapport. Pour le vocabulaire architectural détaillé, le glossaire du rapport Qwen3.8-Max est plus complet.

Tableau des spécifications

Toutes les valeurs numériques du rapport en un seul endroit, avec leur source. C'est la page à copier si vous devez citer un chiffre.

Vérification des paramètres et de la VRAM

Le décompte complet, pas à pas, depuis config.json jusqu'aux 27,729 G — et la vérification par la taille du dépôt à 0,26 % près.

Sources

Toutes les références, classées par fiabilité, avec ce que chacune soutient.


Le script

verif-qwen3-8-27b.py — Python pur, sans dépendance.

python3 verif-qwen3-8-27b.py

Sortie attendue :

  [OK ] total vs étiquette « 28B »                 écart   0.97 %
  [OK ] taille du dépôt vs 55,6 Go                 écart   0.26 %

Il reconstruit les paramètres depuis le config.json publié, calcule le cache clé-valeur, le contrefactuel sans attention hybride, et le contexte tenable par carte pour les trois précisions.

Il ne lit rien en réseau

La configuration y est recopiée en dur, de sorte que le résultat reste reproductible même si le dépôt évolue. Il sort avec un code non nul si une vérification échoue.

Une note sur son histoire

La première version de ce script, écrite avant la publication du modèle, calculait des bornes sous trois hypothèses d'architecture.

Le scénario qui s'est réalisé était l'un des deux jugés possibles, et ses chiffres de cache se sont vérifiés exactement — pour des raisons en partie fortuites. Voir Le verdict des hypothèses.


Voir aussi

Pour le cours d'entrée sur les notions utilisées ici — attention linéaire, DeltaNet, cache clé-valeur, quantification — le rapport sur le grand frère est la référence :