Aller au contenu

Face à Qwen3.8-Max

Une même recette, deux échelles — et un petit modèle plus ouvert que le grand.


Ce qui est descendu

La publication du Max le 12 août avait livré la recette architecturale de la génération. Deux jours plus tard, on peut mesurer exactement ce qui en est descendu à 27 milliards de paramètres.

Ingrédient Max 27B Descendu ?
Ratio hybride 3:1 3:1 ✅ identique
Gated DeltaNet oui oui ✅
Porte de sortie sur l'attention oui oui ✅
Dimension de tête 256 256 ✅ identique
Têtes clé-valeur 4 4 ✅ identique
RoPE partiel 25 % 25 % ✅ identique
Base RoPE \(10^7\) \(10^7\) ✅ identique
Vocabulaire 248 320 248 320 ✅ identique
Contexte natif 262 144 262 144 ✅ identique
Prédiction multi-jetons 1 couche 1 couche ✅
État DeltaNet en float32 oui oui ✅
MoE à 513 experts oui non — réseau dense ❌

Onze ingrédients sur douze descendent tels quels

Ce n'est pas une famille de modèles apparentés : c'est la même architecture, instanciée à deux échelles.

Les seuls paramètres qui changent sont ceux qu'impose l'échelle — nombre de couches (92 contre 64), dimension cachée (8 192 contre 5 120), nombre de têtes de requête (64 contre 24).


Ce qui n'a pas pu descendre

Le Mixture-of-Experts, et la raison est arithmétique.

Qwen3.8-Max Qwen3.8-27B
Réseau après l'attention MoE, 512 + 1 experts dense, 17 408
Paramètres dans ce réseau 2 375,8 G (98,2 %) 17,1 G (61,7 %)
Part activée par jeton 3,94 % 100 %
Facteur stockage / calcul 46 1

Pourquoi le MoE ne descend pas

Le MoE échange de la mémoire contre du calcul. À 2,4 billions de paramètres, l'échange rapporte un facteur 46 : on stocke énormément, on calcule peu.

À 27 milliards, l'échange se retourne. Un MoE de 27 G actifs pèserait 150 à 250 G au total — il ne tiendrait plus sur une carte, ce qui détruirait la seule raison d'être de ce modèle.

C'est exactement l'argument que la première édition de ce rapport avançait pour juger le scénario MoE « improbable ». Il s'est vérifié.


La dimension de cache, identique

Une coïncidence apparente mérite d'être relevée.

Têtes KV Dim. de tête Produit Octets/jeton/couche
Qwen3.8-Max 4 256 1 024 4 096
Qwen3.8-27B 4 256 1 024 4 096

Les deux modèles stockent exactement la même quantité de cache par couche d'attention complète. Le Max en a 23, le 27B en a 16.

Couches complètes Cache par jeton Cache à 262 144
Qwen3.8-Max 23 92 KiO 24,7 Go
Qwen3.8-27B 16 64 KiO 17,18 Go

Ce n'est pas une coïncidence, c'est une contrainte de conception

La dimension du cache est ce qui décide de la faisabilité du contexte long. L'équipe a manifestement fixé \(H_{kv} \times d_h = 1\,024\) comme constante de la génération, et fait varier tout le reste.

Le 27B a donc un cache plus léger que le Max, alors qu'il est 88 fois plus petit — ce qui est logique, mais pas garanti : un modèle plus petit avec plus de couches complètes aurait pu faire pire.


Ce que le petit fait mieux

Trois différences, toutes en faveur du 27B, et aucune n'est technique.

Qwen3.8-Max Qwen3.8-27B
Licence maison, à seuils, non approuvée OSI Apache 2.0
Modalités des poids texte seul (_text) texte, images, vidéo
Raisonnement forcé, non désactivable désactivable

Le modèle réellement ouvert, c'est le petit

Le Max a fait l'événement industriel — premier modèle de gamme « Max » aux poids publiés. Mais c'est le 27B qui est ouvert au sens habituel du terme :

  • licence permissive approuvée OSI, sans seuil ni négociation ;
  • multimodalité conservée dans les poids, au lieu d'être réservée à l'API ;
  • contrôle rendu à l'utilisateur sur le mode de raisonnement.

Le paradoxe mérite d'être noté : le modèle le moins mis en avant est le plus ouvert des deux.


L'écart de capacité

Sur les benchmarks communs aux deux tableaux officiels :

Benchmark 27B Max Écart
OSWorld-Verified 84,3 86,1 −1,8
IFBench 79,5 82,8 −3,3
GPQA Diamond 89,2 92,6 −3,4
CoWorkBench 70,7 74,8 −4,1
SWE-bench Pro 61,7 67,7 −6,0
Agents' Last Exam (Score) 42,9 52,4 −9,5
HLE 30,8 43,6 −12,8
Terminal Bench 2.1 73,0 86,6 −13,6
DeepSWE 1.1 42,2 56,6 −14,4
JobBench 33,4 53,4 −20,0

88 fois moins de paramètres, 2 à 4 points de moins sur l'essentiel

Sur OSWorld, IFBench, GPQA et CoWorkBench, l'écart est de 1,8 à 4,1 points — pour un modèle qui compte 27,7 G contre 2 446 G et en active 3,4 fois moins par jeton.

Mais l'écart se creuse là où la taille compte

HLE (−12,8), JobBench (−20,0), DeepSWE (−14,4), Terminal-Bench (−13,6).

La lecture cohérente : les capacités procédurales — cliquer, suivre un format, appeler un outil — saturent tôt et descendent bien vers les petits modèles. Les capacités de connaissance encyclopédique et de raisonnement long continuent d'échelonner avec le nombre de paramètres.

C'est une conclusion utile bien au-delà de ces deux modèles.

Prudence sur cette comparaison

Les deux tableaux n'ont ni les mêmes concurrents ni forcément les mêmes conditions d'exécution. Qwen ne publie ni le harnais ni le réglage d'effort de raisonnement pour l'un ou l'autre.

L'ordre de grandeur des écarts est parlant ; les valeurs exactes ne doivent pas être surinterprétées.


Lequel choisir

Votre situation Modèle
Exécution locale, sur site, souveraineté 27B — le Max demande 9 à 74 GPU
Besoin de multimodalité en poids ouverts 27B — les poids du Max sont textuels
Produit commercial destiné à croître 27B — Apache 2.0 sans seuil
Raisonnement difficile, connaissance experte Max — +12,8 sur HLE
Agent à très long horizon Max — +20 sur JobBench
Volume important par API Max — 2 $/6 $ le million, sans exploitation

À retenir

Ce chapitre en cinq points

  1. Onze ingrédients architecturaux sur douze descendent du Max au 27B, à l'identique.
  2. Le MoE est le seul à ne pas descendre — il détruirait le positionnement mono-GPU.
  3. Les deux modèles partagent la même dimension de cache : 4 096 octets par jeton et par couche complète.
  4. Le 27B est plus ouvert que le Max sur trois points : licence, modalités, contrôle du raisonnement.
  5. Il est à 2 à 4 points du Max sur les tâches procédurales, mais 12 à 20 points derrière sur la connaissance et le raisonnement long.

Chapitre suivant : Le verdict des hypothèses.