Résumé exécutif¶
Quinze minutes pour l'essentiel : ce qu'est Qwen3.8-27B, ce qu'il vaut, et ce qu'il tient sur votre carte.
En trois phrases¶
Le 14 août 2026, Alibaba publie Qwen3.8-27B : un modèle dense de 27,7 milliards de paramètres, nativement multimodal, sous Apache 2.0.
Son architecture reprend la recette du grand frère Qwen3.8-Max — alternance de 3 couches d'attention linéaire pour 1 couche complète — appliquée à une taille qui tient sur une seule carte graphique.
Et sur plusieurs benchmarks agentiques, il dépasse le Max, qui compte pourtant quatre-vingt-sept fois plus de paramètres.
La fiche, vérifiée¶
Tous les chiffres marqués « recalculé » viennent du seul config.json, via le
script joint.
| Caractéristique | Valeur | Statut |
|---|---|---|
| Paramètres totaux | 27,729 G | recalculé (étiquette : « 28B ») |
| dont modèle de langage | 26,896 G | recalculé |
| dont encodeur visuel | 0,461 G | recalculé |
| dont couche MTP | 0,372 G | recalculé |
| Architecture | dense (pas de MoE) | config.json |
| Couches | 64 | config.json |
| dont attention linéaire | 48 | recalculé |
| dont attention complète | 16 | recalculé |
| Dimension cachée | 5 120 | config.json |
| Dimension du réseau dense | 17 408 | config.json |
| Têtes de requête / clé-valeur | 24 / 4 | config.json |
| Dimension de tête | 256 | config.json |
| Vocabulaire | 248 320 | config.json |
| Contexte natif | 262 144 jetons | config.json |
| Contexte étendu | 1 000 000 jetons (YaRN) | carte de modèle |
| Modalités | texte, images, vidéo | config.json |
| Raisonnement | désactivable | carte de modèle |
| Licence | Apache 2.0 | dépôt |
| Taille du dépôt | 55,6 Go, 18 fragments | dépôt |
L'architecture en un paragraphe¶
Le modèle empile 16 fois le motif suivant :
3 × ( Gated DeltaNet → réseau dense ) puis 1 × ( Attention complète → réseau dense )
Trois couches sur quatre remplacent l'attention classique — dont le coût croît avec le carré de la longueur — par une attention linéaire à état récurrent. La quatrième conserve l'attention complète, nécessaire au rappel exact.
À cela s'ajoutent un encodeur visuel de 27 couches intégré nativement, et une couche de prédiction multi-jetons pour le décodage accéléré.
La conséquence chiffrée, non publiée par Qwen
Seules les 16 couches d'attention complète produisent un cache clé-valeur : 64 KiO par jeton, soit :
- 17,18 Go à 262 144 jetons ;
- 65,54 Go à 1 000 000 de jetons.
La même architecture en attention complète sur les 64 couches demanderait 68,72 Go au contexte natif. L'hybride économise 75 %.
C'est ce qui fait la différence entre un modèle local utilisable et un modèle local frustrant. Détail : Contexte et cache.
Ce que ça tient sur votre carte¶
Poids en 4 bits (13,9 Go), cache en BF16, 90 % de VRAM utile :
| Carte | Contexte utilisable |
|---|---|
| RTX 4090 / 5080 (24 Go) | ~115 600 jetons |
| RTX 5090 (32 Go) | ~225 500 jetons |
| L40S / RTX Pro 6000 (48 Go) | ~445 200 jetons |
| H100 / H200 (80 Go) | ~884 700 jetons |
| Mac 128 Go unifiés | le million complet |
En FP8 — le format recommandé pour l'agentique :
| Carte | Contexte utilisable |
|---|---|
| RTX 4090 (24 Go) | ne charge pas |
| RTX 5090 (32 Go) | ~13 900 jetons |
| L40S (48 Go) | ~233 600 jetons |
| H100 (80 Go) | ~673 100 jetons |
Une carte de 48 Go tient la fenêtre native complète
En 4 bits comme en FP8, 48 Go suffisent à dépasser les 262 144 jetons de contexte natif. C'est le point d'équilibre du modèle.
Calcul complet : L'arithmétique de la VRAM.
Ce que valent les scores¶
Qwen publie deux tableaux : texte et vision-langage. Les concurrents retenus sont Qwen3.6-27B (le prédécesseur), Qwen3.7-Plus, Muse Glimmer-30B et Opus 4.6 Max.
Le saut sur le prédécesseur¶
C'est le résultat le plus net, et le plus crédible puisqu'il compare deux modèles de la même maison et de la même taille.
| Benchmark | Qwen3.6-27B | Qwen3.8-27B | Gain |
|---|---|---|---|
| DeepSWE 1.1 | 13,3 | 42,2 | +28,9 |
| OSWorld-Verified | 63,9 | 84,3 | +20,4 |
| BabyVision | 28,9 | 65,7 | +36,8 |
| Vision2Web | 45,0 | 62,9 | +17,9 |
| RecreationBench | 29,8 | 47,1 | +17,3 |
| WebArena-Verified | 48,8 | 64,8 | +16,0 |
| SWE-MM | 25,7 | 38,6 | +12,9 |
| Terminal Bench 2.1 | 63,4 | 73,0 | +9,6 |
Le gain est concentré sur l'agentique et l'usage d'ordinateur
Sur le raisonnement pur, le progrès est modeste — GPQA Diamond passe de 87,8 à 89,2. Sur le pilotage de machines et le travail à long horizon, il est massif.
C'est exactement le profil observé sur le Max. La génération 3.8 est une génération d'agents, pas de raisonneurs.
Face aux plus gros¶
| Benchmark | Qwen3.8-27B | Opus 4.6 Max | Qwen3.8-Max |
|---|---|---|---|
| SWE-bench Pro | 61,7 | 53,4 | 67,7 |
| OSWorld-Verified | 84,3 | 72,7 | 86,1 |
| CoWorkBench | 70,7 | 68,2 | 74,8 |
| IFBench | 79,5 | 62,5 | 82,8 |
| LiveCodeBench v6 | 90,3 | 88,8 | — |
| GPQA Diamond | 89,2 | 91,3 | 92,6 |
| HLE | 30,8 | 40,0 | 43,6 |
Un 27 G qui talonne un 2 400 G
Sur SWE-bench Pro, OSWorld, CoWorkBench et IFBench, Qwen3.8-27B se situe à 2 à 6 points de Qwen3.8-Max — qui compte 87 fois plus de paramètres et en active 3,4 fois plus par jeton.
L'écart se creuse en revanche nettement sur les tâches de raisonnement pur : −12,8 points sur HLE.
C'est la signature d'un post-entraînement agentique très efficace sur un tronc plus petit — et la confirmation que la capacité brute, elle, se paie en paramètres.
Deux réserves d'usage
Toutes ces valeurs sont mesurées par Qwen. Deux des treize lignes du
tableau texte — QwenSWEBench, CoWorkBench — portent sur des benchmarks
dont Qwen est aussi l'auteur, et le premier affiche justement le plus large
écart favorable du tableau (79,0 contre 49,3 pour le prédécesseur).
Par ailleurs, aucune évaluation indépendante n'existe encore.
Tableaux intégraux : Le tableau officiel.
Ce qui change par rapport au Max¶
Trois différences, toutes en faveur du petit.
| Qwen3.8-Max | Qwen3.8-27B | |
|---|---|---|
| Licence | maison, à seuils, non OSI | Apache 2.0 |
| Modalités des poids | texte seul | texte, images, vidéo |
| Raisonnement | forcé, non désactivable | désactivable (enable_thinking: False) |
Le modèle ouvert, c'est celui-ci
Le Max a fait l'événement industriel. Mais c'est le 27B qui est réellement ouvert au sens habituel du terme : licence permissive approuvée OSI, multimodalité conservée dans les poids, et contrôle rendu à l'utilisateur sur le mode de raisonnement.
Le paradoxe mérite d'être noté : le modèle le moins mis en avant est le plus ouvert des deux.
Ce qui reste inconnu¶
| Sujet | Statut |
|---|---|
| Recette d'entraînement | non publiée |
| Jetons d'entraînement, données | non publiés |
| Ablations justifiant le ratio 3:1 | aucune |
| Évaluations indépendantes | aucune à ce jour |
| Évaluation de sécurité | aucune |
| Modèle de base non affiné | non publié |
| Qualité au-delà de 262 144 jetons | non mesurée |
Voir Ce qui reste non publié.
Verdict¶
Le meilleur modèle local de sa taille au moment de sa sortie, selon les chiffres de son constructeur : multimodal, permissif, économe en cache, et remarquablement fort en agentique pour 27 milliards de paramètres.
Ses limites sont celles de sa génération : aucune documentation d'entraînement, aucune mesure indépendante, et un raisonnement pur qui reste loin des grands modèles.
Pour un usage local, c'est aujourd'hui le choix par défaut. Pour une décision engageante, attendez les premières évaluations tierces.