Aller au contenu

Affirmations à vérifier

Chaque affirmation, son niveau de preuve, et ce qu'il faudrait pour la trancher.


L'échelle utilisée

Niveau Signification
✅ Vérifié contrôlé directement sur la source, le 15 août 2026
🔵 Calculé résultat du script joint, depuis config.json
🟡 Constructeur mesure de Qwen, non vérifiée indépendamment
🟠 Reconstruit déduction de ce rapport, méthode explicitée
🔴 Circule à tort affirmation répandue et non soutenue par les sources

Les faits

# Affirmation Niveau Note
1 Publié le 14 août 2026 ✅ dépôt Hugging Face
2 Licence Apache 2.0 ✅ fichier LICENSE, badge du dépôt
3 Taille du dépôt 55,6 Go, 18 fragments ✅ dépôt
4 Architecture dense, sans MoE ✅ intermediate_size: 17408, pas de num_experts
5 64 couches, hybride 3:1 ✅ layer_types, full_attention_interval: 4
6 24 têtes de requête, 4 clé-valeur, dim. 256 ✅ config.json
7 Contexte natif 262 144 ✅ max_position_embeddings
8 Contexte étendu 1 000 000 via YaRN 🟡 carte de modèle, non mesuré
9 Multimodal — texte, images, vidéo ✅ vision_config, language_model_only: false
10 Raisonnement désactivable ✅ enable_thinking: False, carte de modèle
11 Couche MTP présente ✅ mtp_num_hidden_layers: 1
12 Variante FP8 officielle ✅ dépôt Qwen3.8-27B-FP8

Les calculs

# Résultat Niveau
13 27,729 G de paramètres au total 🔵 écart 0,97 % avec l'étiquette « 28B »
14 dont 26,896 G pour le modèle de langage 🔵
15 dont 0,461 G pour l'encodeur visuel 🟠 reconstruit — structure non documentée
16 dont 0,372 G pour la couche MTP 🟠 reconstruit
17 Taille du dépôt en BF16 : 55,46 Go 🔵 écart 0,26 % avec 55,6 Go observés
18 Cache : 64 KiO/jeton, 17,18 Go à 262 144 🔵
19 Contrefactuel 64 couches complètes : 68,72 Go 🔵 — 75 % d'économie
20 État DeltaNet : 0,159 Go, constant 🔵
21 RTX 4090 en 4 bits : ~115 600 jetons 🔵
22 Une carte de 48 Go tient la fenêtre native 🔵

Ce que l'accord à 0,26 % établit

Les lignes 15 et 16 sont des reconstructions : ni la structure de l'encodeur visuel ni celle de la couche MTP ne sont documentées.

Mais leur somme est contrainte : le total recalculé retrouve la taille du dépôt à 0,26 % près. Une erreur importante sur l'un ou l'autre s'y verrait.

Ce qui est établi : il y a environ 0,83 G de paramètres au-delà du modèle de langage, et config.json en donne l'explication la plus simple.

La limite du raisonnement

Un accord numérique n'est pas une preuve formelle. Une répartition différente entre encodeur visuel et couche MTP totalisant ~0,83 G donnerait le même résultat.

Pour trancher, il faudrait inspecter la liste des tenseurs du dépôt — un travail de quelques minutes pour qui télécharge l'index des safetensors.


Les benchmarks

# Affirmation Niveau
23 30 lignes de benchmarks, texte et vision 🟡 mesures Qwen
24 +36,8 sur BabyVision face au prédécesseur 🟡
25 +28,9 sur DeepSWE, +20,4 sur OSWorld 🟡
26 +1,4 seulement sur GPQA Diamond 🟡
27 Bat Opus 4.6 Max sur 15 lignes sur 19 🟡
28 À 2 à 4 points de Qwen3.8-Max sur l'agentique 🟡 comparaison entre deux tableaux distincts
29 Aucune évaluation indépendante ✅ recherche au 15 août 2026

Deux réserves sur la ligne 28

Les tableaux du Max et du 27B n'ont ni les mêmes concurrents ni forcément les mêmes conditions d'exécution. Ni le harnais ni l'effort de raisonnement ne sont documentés pour l'un ou l'autre.

L'ordre de grandeur est parlant ; les valeurs exactes ne doivent pas être surinterprétées.


Ce qui circule à tort

🔴 « Il suffit de 14 Go de VRAM pour le faire tourner »

Ce chiffre ne compte que les poids en quantification 4 bits. Il est exact et incomplet.

Sur 24 Go, les 13,86 Go de poids laissent 7,58 Go, soit environ 115 600 jetons de contexte — 44 % de la fenêtre native, pas 100 %.

Voir L'arithmétique de la VRAM.

🔴 « Le modèle a un contexte de 1 million de jetons »

Il a un contexte natif de 262 144 jetons, extensible à 1 000 000 par YaRN. L'extension fonctionne, mais aucun benchmark ne la mesure, et l'attention linéaire est connue pour dégrader le rappel à longue distance.

Et sur du matériel accessible, le million reste hors de portée : seule une machine à 110 Go de mémoire utile y arrive.

🔴 « Il bat Qwen3.8-Max »

Sur aucun benchmark commun aux deux tableaux. Il s'en approche à 1,8 point sur OSWorld, mais reste derrière partout — jusqu'à 20 points sur JobBench.

La formulation correcte est : il talonne un modèle 88 fois plus gros sur les tâches procédurales.

🔴 « Les spécifications sont les mêmes que Qwen3.6-27B »

Faux sur le point qui compte : le prédécesseur est en attention complète, le successeur en hybride 3:1. C'est un facteur 4 sur le cache.


Ce qui reste à trancher

Incertitude Ce qui la lèverait
#8 — qualité du contexte étendu une évaluation RULER ou MRCR à 262 K et 1 M
#15, #16 — répartition vision / MTP l'inspection de l'index des safetensors
#23 à #28 — benchmarks une reproduction indépendante, conditions publiées
Dégradation par quantification une comparaison BF16 / FP8 / 4 bits sur un même benchmark
Sécurité une évaluation par un organisme indépendant

Les deux premières sont à la portée de n'importe qui disposant du matériel. La troisième arrivera d'elle-même dans les jours qui viennent.


À retenir

Ce chapitre en cinq points

  1. Douze faits vérifiés directement sur le dépôt, dont la licence Apache 2.0 et l'architecture dense hybride.
  2. Les calculs retrouvent la taille du dépôt à 0,26 %, ce qui contraint les deux reconstructions (encodeur visuel, couche MTP).
  3. Tous les benchmarks viennent de Qwen ; aucune évaluation indépendante n'existe encore.
  4. Quatre affirmations circulent à tort, dont « 14 Go suffisent » et « contexte d'un million ».
  5. La qualité du contexte étendu reste la principale inconnue, et elle est mesurable par n'importe qui.

Partie suivante : Annexes.