Affirmations à vérifier¶
Chaque affirmation, son niveau de preuve, et ce qu'il faudrait pour la trancher.
L'échelle utilisée¶
| Niveau | Signification |
|---|---|
| ✅ Vérifié | contrôlé directement sur la source, le 15 août 2026 |
| 🔵 Calculé | résultat du script joint, depuis config.json |
| 🟡 Constructeur | mesure de Qwen, non vérifiée indépendamment |
| 🟠 Reconstruit | déduction de ce rapport, méthode explicitée |
| 🔴 Circule à tort | affirmation répandue et non soutenue par les sources |
Les faits¶
| # | Affirmation | Niveau | Note |
|---|---|---|---|
| 1 | Publié le 14 août 2026 | ✅ | dépôt Hugging Face |
| 2 | Licence Apache 2.0 | ✅ | fichier LICENSE, badge du dépôt |
| 3 | Taille du dépôt 55,6 Go, 18 fragments | ✅ | dépôt |
| 4 | Architecture dense, sans MoE | ✅ | intermediate_size: 17408, pas de num_experts |
| 5 | 64 couches, hybride 3:1 | ✅ | layer_types, full_attention_interval: 4 |
| 6 | 24 têtes de requête, 4 clé-valeur, dim. 256 | ✅ | config.json |
| 7 | Contexte natif 262 144 | ✅ | max_position_embeddings |
| 8 | Contexte étendu 1 000 000 via YaRN | 🟡 | carte de modèle, non mesuré |
| 9 | Multimodal — texte, images, vidéo | ✅ | vision_config, language_model_only: false |
| 10 | Raisonnement désactivable | ✅ | enable_thinking: False, carte de modèle |
| 11 | Couche MTP présente | ✅ | mtp_num_hidden_layers: 1 |
| 12 | Variante FP8 officielle | ✅ | dépôt Qwen3.8-27B-FP8 |
Les calculs¶
| # | Résultat | Niveau |
|---|---|---|
| 13 | 27,729 G de paramètres au total | 🔵 écart 0,97 % avec l'étiquette « 28B » |
| 14 | dont 26,896 G pour le modèle de langage | 🔵 |
| 15 | dont 0,461 G pour l'encodeur visuel | 🟠 reconstruit — structure non documentée |
| 16 | dont 0,372 G pour la couche MTP | 🟠 reconstruit |
| 17 | Taille du dépôt en BF16 : 55,46 Go | 🔵 écart 0,26 % avec 55,6 Go observés |
| 18 | Cache : 64 KiO/jeton, 17,18 Go à 262 144 | 🔵 |
| 19 | Contrefactuel 64 couches complètes : 68,72 Go | 🔵 — 75 % d'économie |
| 20 | État DeltaNet : 0,159 Go, constant | 🔵 |
| 21 | RTX 4090 en 4 bits : ~115 600 jetons | 🔵 |
| 22 | Une carte de 48 Go tient la fenêtre native | 🔵 |
Ce que l'accord à 0,26 % établit
Les lignes 15 et 16 sont des reconstructions : ni la structure de l'encodeur visuel ni celle de la couche MTP ne sont documentées.
Mais leur somme est contrainte : le total recalculé retrouve la taille du dépôt à 0,26 % près. Une erreur importante sur l'un ou l'autre s'y verrait.
Ce qui est établi : il y a environ 0,83 G de paramètres au-delà du modèle
de langage, et config.json en donne l'explication la plus simple.
La limite du raisonnement
Un accord numérique n'est pas une preuve formelle. Une répartition différente entre encodeur visuel et couche MTP totalisant ~0,83 G donnerait le même résultat.
Pour trancher, il faudrait inspecter la liste des tenseurs du dépôt — un travail de quelques minutes pour qui télécharge l'index des safetensors.
Les benchmarks¶
| # | Affirmation | Niveau |
|---|---|---|
| 23 | 30 lignes de benchmarks, texte et vision | 🟡 mesures Qwen |
| 24 | +36,8 sur BabyVision face au prédécesseur | 🟡 |
| 25 | +28,9 sur DeepSWE, +20,4 sur OSWorld | 🟡 |
| 26 | +1,4 seulement sur GPQA Diamond | 🟡 |
| 27 | Bat Opus 4.6 Max sur 15 lignes sur 19 | 🟡 |
| 28 | À 2 à 4 points de Qwen3.8-Max sur l'agentique | 🟡 comparaison entre deux tableaux distincts |
| 29 | Aucune évaluation indépendante | ✅ recherche au 15 août 2026 |
Deux réserves sur la ligne 28
Les tableaux du Max et du 27B n'ont ni les mêmes concurrents ni forcément les mêmes conditions d'exécution. Ni le harnais ni l'effort de raisonnement ne sont documentés pour l'un ou l'autre.
L'ordre de grandeur est parlant ; les valeurs exactes ne doivent pas être surinterprétées.
Ce qui circule à tort¶
🔴 « Il suffit de 14 Go de VRAM pour le faire tourner »¶
Ce chiffre ne compte que les poids en quantification 4 bits. Il est exact et incomplet.
Sur 24 Go, les 13,86 Go de poids laissent 7,58 Go, soit environ 115 600 jetons de contexte — 44 % de la fenêtre native, pas 100 %.
Voir L'arithmétique de la VRAM.
🔴 « Le modèle a un contexte de 1 million de jetons »¶
Il a un contexte natif de 262 144 jetons, extensible à 1 000 000 par YaRN. L'extension fonctionne, mais aucun benchmark ne la mesure, et l'attention linéaire est connue pour dégrader le rappel à longue distance.
Et sur du matériel accessible, le million reste hors de portée : seule une machine à 110 Go de mémoire utile y arrive.
🔴 « Il bat Qwen3.8-Max »¶
Sur aucun benchmark commun aux deux tableaux. Il s'en approche à 1,8 point sur OSWorld, mais reste derrière partout — jusqu'à 20 points sur JobBench.
La formulation correcte est : il talonne un modèle 88 fois plus gros sur les tâches procédurales.
🔴 « Les spécifications sont les mêmes que Qwen3.6-27B »¶
Faux sur le point qui compte : le prédécesseur est en attention complète, le successeur en hybride 3:1. C'est un facteur 4 sur le cache.
Ce qui reste à trancher¶
| Incertitude | Ce qui la lèverait |
|---|---|
| #8 — qualité du contexte étendu | une évaluation RULER ou MRCR à 262 K et 1 M |
| #15, #16 — répartition vision / MTP | l'inspection de l'index des safetensors |
| #23 à #28 — benchmarks | une reproduction indépendante, conditions publiées |
| Dégradation par quantification | une comparaison BF16 / FP8 / 4 bits sur un même benchmark |
| Sécurité | une évaluation par un organisme indépendant |
Les deux premières sont à la portée de n'importe qui disposant du matériel. La troisième arrivera d'elle-même dans les jours qui viennent.
À retenir¶
Ce chapitre en cinq points
- Douze faits vérifiés directement sur le dépôt, dont la licence Apache 2.0 et l'architecture dense hybride.
- Les calculs retrouvent la taille du dépôt à 0,26 %, ce qui contraint les deux reconstructions (encodeur visuel, couche MTP).
- Tous les benchmarks viennent de Qwen ; aucune évaluation indépendante n'existe encore.
- Quatre affirmations circulent à tort, dont « 14 Go suffisent » et « contexte d'un million ».
- La qualité du contexte étendu reste la principale inconnue, et elle est mesurable par n'importe qui.
Partie suivante : Annexes.