Aller au contenu

Le précédent Qwen3.6-27B

Ce que le successeur garde, ce qu'il change, et le saut mesuré entre les deux.


Ce qu'était Qwen3.6-27B

Publié en avril 2026, c'est le modèle dense de milieu de gamme de la génération précédente — et l'un des modèles locaux les plus utilisés de l'année.

Caractéristique Valeur
Architecture dense, attention complète
Paramètres ~27 milliards
Couches 64
Dimension cachée 5 120
Contexte natif 262 144 jetons
Contexte étendu ~1 010 000 jetons, via YaRN
Modalités texte, image, vidéo
Licence Apache 2.0
SWE-bench Verified 77,2
Terminal-Bench 2.0 59,3
Matériel minimal une carte de 16 Go en Q4_K_M

Sa réputation tenait à un fait simple : sur le codage, il dépassait le MoE de 397 milliards de paramètres qu'il remplaçait dans la gamme.


Ce que le successeur garde

Beaucoup, et c'est délibéré.

Élément conservé Valeur
Nombre de couches 64
Dimension cachée 5 120
Contexte natif 262 144
Modalités texte, image, vidéo
Licence Apache 2.0
Ordre de grandeur des paramètres ~27 G

Préserver l'écosystème était l'enjeu, et il est atteint

La première édition de ce rapport avançait qu'un successeur avait tout intérêt à ne pas casser la compatibilité — moteurs, formats, quantifications, licence — sous peine de perdre dix mois d'écosystème accumulé.

C'est exactement ce qui s'est passé. Les quantifications GGUF, MLX, NVFP4 et AWQ étaient disponibles dès le lendemain de la publication.


Ce que le successeur change

Deux choses seulement, mais elles portent loin.

1. L'attention devient hybride

Qwen3.6-27B Qwen3.8-27B
Couches à attention complète 64 16
Couches à attention linéaire 0 48
Cache par jeton 256 KiO (estimé) 64 KiO
Cache à 262 144 jetons ~68,7 Go 17,18 Go

C'est le vrai apport de la génération pour un usage local

Sur une RTX 4090 de 24 Go en 4 bits, cela change le contexte utilisable d'environ 31 000 jetons à 115 600.

Un modèle qui passe de « répondre à des questions » à « analyser un dépôt de code », sans changer de carte.

Détail : Contexte et cache.

2. La prédiction multi-jetons apparaît

mtp_num_hidden_layers: 1 — une couche supplémentaire de 372 M de paramètres, qui permet le décodage spéculatif intégré.

Sur un usage local où la vitesse est la contrainte principale, c'est un gain gratuit, déjà payé au téléchargement.


Le saut mesuré

C'est la comparaison la plus solide du tableau officiel : deux modèles de même taille, de la même maison, mesurés par la même équipe.

Benchmark Qwen3.6-27B Qwen3.8-27B Gain
BabyVision 28,9 65,7 +36,8
QwenSWEBench 49,3 79,0 +29,7
DeepSWE 1.1 13,3 42,2 +28,9
OSWorld-Verified 63,9 84,3 +20,4
Vision2Web 45,0 62,9 +17,9
RecreationBench 29,8 47,1 +17,3
WebArena-Verified 48,8 64,8 +16,0
SWE-MM 25,7 38,6 +12,9
AndroidWorld 70,3 81,9 +11,6
IFBench 69,1 79,5 +10,4
Terminal Bench 2.1 63,4 73,0 +9,6
SWE-bench Pro 53,5 61,7 +8,2
HLE 24,0 30,8 +6,8
LiveCodeBench v6 83,9 90,3 +6,4
GPQA Diamond 87,8 89,2 +1,4

Le profil est net

Les gains les plus larges portent sur le pilotage de machines, le codage agentique et le raisonnement visuel.

Le plus faible porte sur le raisonnement scientifique pur : +1,4 point.

Ce que l'architecture n'explique pas

L'attention hybride explique le gain de mémoire. Elle n'explique pas le gain de capacité : passer une couche sur quatre en attention linéaire n'améliore pas, en soi, le pilotage d'un système d'exploitation.

Ces vingt à trente-sept points viennent forcément des données et du post-entraînement. Or ni l'un ni l'autre n'est documenté, et aucune ablation n'est publiée.

On mesure le progrès. On ne sait pas d'où il vient.


Faut-il migrer

Votre situation Recommandation
Usage agentique, pilotage d'outils oui, sans hésiter — le gain est massif
Usage visuel oui — jusqu'à +36,8 points
Codage sur dépôt oui — +8,2 sur SWE-bench Pro
Contexte long sur carte modeste oui — le cache est divisé par quatre
Questions-réponses, raisonnement pur marginal — +1,4 sur GPQA
Chaîne en production, stable, validée attendez les évaluations indépendantes

Le coût de la migration est faible

Même licence, même taille, même famille de moteurs, mêmes formats de quantification. Ce n'est pas un changement d'infrastructure.

Deux points à vérifier tout de même : les paramètres d'échantillonnage diffèrent selon le mode (voir Servir le modèle), et le poids augmente légèrement — 55,6 Go contre ~54.


À retenir

Ce chapitre en cinq points

  1. Le successeur conserve le nombre de couches, la dimension cachée, le contexte, les modalités et la licence.
  2. Il change deux choses : l'attention devient hybride 3:1, et une couche MTP apparaît.
  3. L'hybride divise le cache par quatre — de 31 000 à 115 600 jetons utilisables sur une RTX 4090.
  4. Le saut mesuré est massif sur l'agentique et le visuel (jusqu'à +36,8), quasi nul sur le raisonnement pur (+1,4).
  5. L'origine de ce gain — données, post-entraînement — n'est pas documentée.

Chapitre suivant : Face à Qwen3.8-Max.