Le précédent Qwen3.6-27B¶
Ce que le successeur garde, ce qu'il change, et le saut mesuré entre les deux.
Ce qu'était Qwen3.6-27B¶
Publié en avril 2026, c'est le modèle dense de milieu de gamme de la génération précédente — et l'un des modèles locaux les plus utilisés de l'année.
| Caractéristique | Valeur |
|---|---|
| Architecture | dense, attention complète |
| Paramètres | ~27 milliards |
| Couches | 64 |
| Dimension cachée | 5 120 |
| Contexte natif | 262 144 jetons |
| Contexte étendu | ~1 010 000 jetons, via YaRN |
| Modalités | texte, image, vidéo |
| Licence | Apache 2.0 |
| SWE-bench Verified | 77,2 |
| Terminal-Bench 2.0 | 59,3 |
| Matériel minimal | une carte de 16 Go en Q4_K_M |
Sa réputation tenait à un fait simple : sur le codage, il dépassait le MoE de 397 milliards de paramètres qu'il remplaçait dans la gamme.
Ce que le successeur garde¶
Beaucoup, et c'est délibéré.
| Élément conservé | Valeur |
|---|---|
| Nombre de couches | 64 |
| Dimension cachée | 5 120 |
| Contexte natif | 262 144 |
| Modalités | texte, image, vidéo |
| Licence | Apache 2.0 |
| Ordre de grandeur des paramètres | ~27 G |
Préserver l'écosystème était l'enjeu, et il est atteint
La première édition de ce rapport avançait qu'un successeur avait tout intérêt à ne pas casser la compatibilité — moteurs, formats, quantifications, licence — sous peine de perdre dix mois d'écosystème accumulé.
C'est exactement ce qui s'est passé. Les quantifications GGUF, MLX, NVFP4 et AWQ étaient disponibles dès le lendemain de la publication.
Ce que le successeur change¶
Deux choses seulement, mais elles portent loin.
1. L'attention devient hybride¶
| Qwen3.6-27B | Qwen3.8-27B | |
|---|---|---|
| Couches à attention complète | 64 | 16 |
| Couches à attention linéaire | 0 | 48 |
| Cache par jeton | 256 KiO (estimé) | 64 KiO |
| Cache à 262 144 jetons | ~68,7 Go | 17,18 Go |
C'est le vrai apport de la génération pour un usage local
Sur une RTX 4090 de 24 Go en 4 bits, cela change le contexte utilisable d'environ 31 000 jetons à 115 600.
Un modèle qui passe de « répondre à des questions » à « analyser un dépôt de code », sans changer de carte.
Détail : Contexte et cache.
2. La prédiction multi-jetons apparaît¶
mtp_num_hidden_layers: 1 — une couche supplémentaire de 372 M de paramètres,
qui permet le décodage spéculatif intégré.
Sur un usage local où la vitesse est la contrainte principale, c'est un gain gratuit, déjà payé au téléchargement.
Le saut mesuré¶
C'est la comparaison la plus solide du tableau officiel : deux modèles de même taille, de la même maison, mesurés par la même équipe.
| Benchmark | Qwen3.6-27B | Qwen3.8-27B | Gain |
|---|---|---|---|
| BabyVision | 28,9 | 65,7 | +36,8 |
| QwenSWEBench | 49,3 | 79,0 | +29,7 |
| DeepSWE 1.1 | 13,3 | 42,2 | +28,9 |
| OSWorld-Verified | 63,9 | 84,3 | +20,4 |
| Vision2Web | 45,0 | 62,9 | +17,9 |
| RecreationBench | 29,8 | 47,1 | +17,3 |
| WebArena-Verified | 48,8 | 64,8 | +16,0 |
| SWE-MM | 25,7 | 38,6 | +12,9 |
| AndroidWorld | 70,3 | 81,9 | +11,6 |
| IFBench | 69,1 | 79,5 | +10,4 |
| Terminal Bench 2.1 | 63,4 | 73,0 | +9,6 |
| SWE-bench Pro | 53,5 | 61,7 | +8,2 |
| HLE | 24,0 | 30,8 | +6,8 |
| LiveCodeBench v6 | 83,9 | 90,3 | +6,4 |
| GPQA Diamond | 87,8 | 89,2 | +1,4 |
Le profil est net
Les gains les plus larges portent sur le pilotage de machines, le codage agentique et le raisonnement visuel.
Le plus faible porte sur le raisonnement scientifique pur : +1,4 point.
Ce que l'architecture n'explique pas
L'attention hybride explique le gain de mémoire. Elle n'explique pas le gain de capacité : passer une couche sur quatre en attention linéaire n'améliore pas, en soi, le pilotage d'un système d'exploitation.
Ces vingt à trente-sept points viennent forcément des données et du post-entraînement. Or ni l'un ni l'autre n'est documenté, et aucune ablation n'est publiée.
On mesure le progrès. On ne sait pas d'où il vient.
Faut-il migrer¶
| Votre situation | Recommandation |
|---|---|
| Usage agentique, pilotage d'outils | oui, sans hésiter — le gain est massif |
| Usage visuel | oui — jusqu'à +36,8 points |
| Codage sur dépôt | oui — +8,2 sur SWE-bench Pro |
| Contexte long sur carte modeste | oui — le cache est divisé par quatre |
| Questions-réponses, raisonnement pur | marginal — +1,4 sur GPQA |
| Chaîne en production, stable, validée | attendez les évaluations indépendantes |
Le coût de la migration est faible
Même licence, même taille, même famille de moteurs, mêmes formats de quantification. Ce n'est pas un changement d'infrastructure.
Deux points à vérifier tout de même : les paramètres d'échantillonnage diffèrent selon le mode (voir Servir le modèle), et le poids augmente légèrement — 55,6 Go contre ~54.
À retenir¶
Ce chapitre en cinq points
- Le successeur conserve le nombre de couches, la dimension cachée, le contexte, les modalités et la licence.
- Il change deux choses : l'attention devient hybride 3:1, et une couche MTP apparaît.
- L'hybride divise le cache par quatre — de 31 000 à 115 600 jetons utilisables sur une RTX 4090.
- Le saut mesuré est massif sur l'agentique et le visuel (jusqu'à +36,8), quasi nul sur le raisonnement pur (+1,4).
- L'origine de ce gain — données, post-entraînement — n'est pas documentée.
Chapitre suivant : Face à Qwen3.8-Max.