Face à Qwen3.8-Max¶
Une même recette, deux échelles — et un petit modèle plus ouvert que le grand.
Ce qui est descendu¶
La publication du Max le 12 août avait livré la recette architecturale de la génération. Deux jours plus tard, on peut mesurer exactement ce qui en est descendu à 27 milliards de paramètres.
| Ingrédient | Max | 27B | Descendu ? |
|---|---|---|---|
| Ratio hybride | 3:1 | 3:1 | ✅ identique |
| Gated DeltaNet | oui | oui | ✅ |
| Porte de sortie sur l'attention | oui | oui | ✅ |
| Dimension de tête | 256 | 256 | ✅ identique |
| Têtes clé-valeur | 4 | 4 | ✅ identique |
| RoPE partiel | 25 % | 25 % | ✅ identique |
| Base RoPE | \(10^7\) | \(10^7\) | ✅ identique |
| Vocabulaire | 248 320 | 248 320 | ✅ identique |
| Contexte natif | 262 144 | 262 144 | ✅ identique |
| Prédiction multi-jetons | 1 couche | 1 couche | ✅ |
| État DeltaNet en float32 | oui | oui | ✅ |
| MoE à 513 experts | oui | non — réseau dense | ❌ |
Onze ingrédients sur douze descendent tels quels
Ce n'est pas une famille de modèles apparentés : c'est la même architecture, instanciée à deux échelles.
Les seuls paramètres qui changent sont ceux qu'impose l'échelle — nombre de couches (92 contre 64), dimension cachée (8 192 contre 5 120), nombre de têtes de requête (64 contre 24).
Ce qui n'a pas pu descendre¶
Le Mixture-of-Experts, et la raison est arithmétique.
| Qwen3.8-Max | Qwen3.8-27B | |
|---|---|---|
| Réseau après l'attention | MoE, 512 + 1 experts | dense, 17 408 |
| Paramètres dans ce réseau | 2 375,8 G (98,2 %) | 17,1 G (61,7 %) |
| Part activée par jeton | 3,94 % | 100 % |
| Facteur stockage / calcul | 46 | 1 |
Pourquoi le MoE ne descend pas
Le MoE échange de la mémoire contre du calcul. À 2,4 billions de paramètres, l'échange rapporte un facteur 46 : on stocke énormément, on calcule peu.
À 27 milliards, l'échange se retourne. Un MoE de 27 G actifs pèserait 150 à 250 G au total — il ne tiendrait plus sur une carte, ce qui détruirait la seule raison d'être de ce modèle.
C'est exactement l'argument que la première édition de ce rapport avançait pour juger le scénario MoE « improbable ». Il s'est vérifié.
La dimension de cache, identique¶
Une coïncidence apparente mérite d'être relevée.
| Têtes KV | Dim. de tête | Produit | Octets/jeton/couche | |
|---|---|---|---|---|
| Qwen3.8-Max | 4 | 256 | 1 024 | 4 096 |
| Qwen3.8-27B | 4 | 256 | 1 024 | 4 096 |
Les deux modèles stockent exactement la même quantité de cache par couche d'attention complète. Le Max en a 23, le 27B en a 16.
| Couches complètes | Cache par jeton | Cache à 262 144 | |
|---|---|---|---|
| Qwen3.8-Max | 23 | 92 KiO | 24,7 Go |
| Qwen3.8-27B | 16 | 64 KiO | 17,18 Go |
Ce n'est pas une coïncidence, c'est une contrainte de conception
La dimension du cache est ce qui décide de la faisabilité du contexte long. L'équipe a manifestement fixé \(H_{kv} \times d_h = 1\,024\) comme constante de la génération, et fait varier tout le reste.
Le 27B a donc un cache plus léger que le Max, alors qu'il est 88 fois plus petit — ce qui est logique, mais pas garanti : un modèle plus petit avec plus de couches complètes aurait pu faire pire.
Ce que le petit fait mieux¶
Trois différences, toutes en faveur du 27B, et aucune n'est technique.
| Qwen3.8-Max | Qwen3.8-27B | |
|---|---|---|
| Licence | maison, à seuils, non approuvée OSI | Apache 2.0 |
| Modalités des poids | texte seul (_text) |
texte, images, vidéo |
| Raisonnement | forcé, non désactivable | désactivable |
Le modèle réellement ouvert, c'est le petit
Le Max a fait l'événement industriel — premier modèle de gamme « Max » aux poids publiés. Mais c'est le 27B qui est ouvert au sens habituel du terme :
- licence permissive approuvée OSI, sans seuil ni négociation ;
- multimodalité conservée dans les poids, au lieu d'être réservée à l'API ;
- contrôle rendu à l'utilisateur sur le mode de raisonnement.
Le paradoxe mérite d'être noté : le modèle le moins mis en avant est le plus ouvert des deux.
L'écart de capacité¶
Sur les benchmarks communs aux deux tableaux officiels :
| Benchmark | 27B | Max | Écart |
|---|---|---|---|
| OSWorld-Verified | 84,3 | 86,1 | −1,8 |
| IFBench | 79,5 | 82,8 | −3,3 |
| GPQA Diamond | 89,2 | 92,6 | −3,4 |
| CoWorkBench | 70,7 | 74,8 | −4,1 |
| SWE-bench Pro | 61,7 | 67,7 | −6,0 |
| Agents' Last Exam (Score) | 42,9 | 52,4 | −9,5 |
| HLE | 30,8 | 43,6 | −12,8 |
| Terminal Bench 2.1 | 73,0 | 86,6 | −13,6 |
| DeepSWE 1.1 | 42,2 | 56,6 | −14,4 |
| JobBench | 33,4 | 53,4 | −20,0 |
88 fois moins de paramètres, 2 à 4 points de moins sur l'essentiel
Sur OSWorld, IFBench, GPQA et CoWorkBench, l'écart est de 1,8 à 4,1 points — pour un modèle qui compte 27,7 G contre 2 446 G et en active 3,4 fois moins par jeton.
Mais l'écart se creuse là où la taille compte
HLE (−12,8), JobBench (−20,0), DeepSWE (−14,4), Terminal-Bench (−13,6).
La lecture cohérente : les capacités procédurales — cliquer, suivre un format, appeler un outil — saturent tôt et descendent bien vers les petits modèles. Les capacités de connaissance encyclopédique et de raisonnement long continuent d'échelonner avec le nombre de paramètres.
C'est une conclusion utile bien au-delà de ces deux modèles.
Prudence sur cette comparaison
Les deux tableaux n'ont ni les mêmes concurrents ni forcément les mêmes conditions d'exécution. Qwen ne publie ni le harnais ni le réglage d'effort de raisonnement pour l'un ou l'autre.
L'ordre de grandeur des écarts est parlant ; les valeurs exactes ne doivent pas être surinterprétées.
Lequel choisir¶
| Votre situation | Modèle |
|---|---|
| Exécution locale, sur site, souveraineté | 27B — le Max demande 9 à 74 GPU |
| Besoin de multimodalité en poids ouverts | 27B — les poids du Max sont textuels |
| Produit commercial destiné à croître | 27B — Apache 2.0 sans seuil |
| Raisonnement difficile, connaissance experte | Max — +12,8 sur HLE |
| Agent à très long horizon | Max — +20 sur JobBench |
| Volume important par API | Max — 2 $/6 $ le million, sans exploitation |
À retenir¶
Ce chapitre en cinq points
- Onze ingrédients architecturaux sur douze descendent du Max au 27B, à l'identique.
- Le MoE est le seul à ne pas descendre — il détruirait le positionnement mono-GPU.
- Les deux modèles partagent la même dimension de cache : 4 096 octets par jeton et par couche complète.
- Le 27B est plus ouvert que le Max sur trois points : licence, modalités, contrôle du raisonnement.
- Il est à 2 à 4 points du Max sur les tâches procédurales, mais 12 à 20 points derrière sur la connaissance et le raisonnement long.
Chapitre suivant : Le verdict des hypothèses.