Aller au contenu

Résumé exécutif

Quinze minutes pour l'essentiel : ce qu'est Qwen3.8-27B, ce qu'il vaut, et ce qu'il tient sur votre carte.


En trois phrases

Le 14 août 2026, Alibaba publie Qwen3.8-27B : un modèle dense de 27,7 milliards de paramètres, nativement multimodal, sous Apache 2.0.

Son architecture reprend la recette du grand frère Qwen3.8-Max — alternance de 3 couches d'attention linéaire pour 1 couche complète — appliquée à une taille qui tient sur une seule carte graphique.

Et sur plusieurs benchmarks agentiques, il dépasse le Max, qui compte pourtant quatre-vingt-sept fois plus de paramètres.


La fiche, vérifiée

Tous les chiffres marqués « recalculé » viennent du seul config.json, via le script joint.

Caractéristique Valeur Statut
Paramètres totaux 27,729 G recalculé (étiquette : « 28B »)
dont modèle de langage 26,896 G recalculé
dont encodeur visuel 0,461 G recalculé
dont couche MTP 0,372 G recalculé
Architecture dense (pas de MoE) config.json
Couches 64 config.json
dont attention linéaire 48 recalculé
dont attention complète 16 recalculé
Dimension cachée 5 120 config.json
Dimension du réseau dense 17 408 config.json
Têtes de requête / clé-valeur 24 / 4 config.json
Dimension de tête 256 config.json
Vocabulaire 248 320 config.json
Contexte natif 262 144 jetons config.json
Contexte étendu 1 000 000 jetons (YaRN) carte de modèle
Modalités texte, images, vidéo config.json
Raisonnement désactivable carte de modèle
Licence Apache 2.0 dépôt
Taille du dépôt 55,6 Go, 18 fragments dépôt

L'architecture en un paragraphe

Le modèle empile 16 fois le motif suivant :

3 × ( Gated DeltaNet → réseau dense )   puis   1 × ( Attention complète → réseau dense )

Trois couches sur quatre remplacent l'attention classique — dont le coût croît avec le carré de la longueur — par une attention linéaire à état récurrent. La quatrième conserve l'attention complète, nécessaire au rappel exact.

À cela s'ajoutent un encodeur visuel de 27 couches intégré nativement, et une couche de prédiction multi-jetons pour le décodage accéléré.

La conséquence chiffrée, non publiée par Qwen

Seules les 16 couches d'attention complète produisent un cache clé-valeur : 64 KiO par jeton, soit :

  • 17,18 Go à 262 144 jetons ;
  • 65,54 Go à 1 000 000 de jetons.

La même architecture en attention complète sur les 64 couches demanderait 68,72 Go au contexte natif. L'hybride économise 75 %.

C'est ce qui fait la différence entre un modèle local utilisable et un modèle local frustrant. Détail : Contexte et cache.


Ce que ça tient sur votre carte

Poids en 4 bits (13,9 Go), cache en BF16, 90 % de VRAM utile :

Carte Contexte utilisable
RTX 4090 / 5080 (24 Go) ~115 600 jetons
RTX 5090 (32 Go) ~225 500 jetons
L40S / RTX Pro 6000 (48 Go) ~445 200 jetons
H100 / H200 (80 Go) ~884 700 jetons
Mac 128 Go unifiés le million complet

En FP8 — le format recommandé pour l'agentique :

Carte Contexte utilisable
RTX 4090 (24 Go) ne charge pas
RTX 5090 (32 Go) ~13 900 jetons
L40S (48 Go) ~233 600 jetons
H100 (80 Go) ~673 100 jetons

Une carte de 48 Go tient la fenêtre native complète

En 4 bits comme en FP8, 48 Go suffisent à dépasser les 262 144 jetons de contexte natif. C'est le point d'équilibre du modèle.

Calcul complet : L'arithmétique de la VRAM.


Ce que valent les scores

Qwen publie deux tableaux : texte et vision-langage. Les concurrents retenus sont Qwen3.6-27B (le prédécesseur), Qwen3.7-Plus, Muse Glimmer-30B et Opus 4.6 Max.

Le saut sur le prédécesseur

C'est le résultat le plus net, et le plus crédible puisqu'il compare deux modèles de la même maison et de la même taille.

Benchmark Qwen3.6-27B Qwen3.8-27B Gain
DeepSWE 1.1 13,3 42,2 +28,9
OSWorld-Verified 63,9 84,3 +20,4
BabyVision 28,9 65,7 +36,8
Vision2Web 45,0 62,9 +17,9
RecreationBench 29,8 47,1 +17,3
WebArena-Verified 48,8 64,8 +16,0
SWE-MM 25,7 38,6 +12,9
Terminal Bench 2.1 63,4 73,0 +9,6

Le gain est concentré sur l'agentique et l'usage d'ordinateur

Sur le raisonnement pur, le progrès est modeste — GPQA Diamond passe de 87,8 à 89,2. Sur le pilotage de machines et le travail à long horizon, il est massif.

C'est exactement le profil observé sur le Max. La génération 3.8 est une génération d'agents, pas de raisonneurs.

Face aux plus gros

Benchmark Qwen3.8-27B Opus 4.6 Max Qwen3.8-Max
SWE-bench Pro 61,7 53,4 67,7
OSWorld-Verified 84,3 72,7 86,1
CoWorkBench 70,7 68,2 74,8
IFBench 79,5 62,5 82,8
LiveCodeBench v6 90,3 88,8 —
GPQA Diamond 89,2 91,3 92,6
HLE 30,8 40,0 43,6

Un 27 G qui talonne un 2 400 G

Sur SWE-bench Pro, OSWorld, CoWorkBench et IFBench, Qwen3.8-27B se situe à 2 à 6 points de Qwen3.8-Max — qui compte 87 fois plus de paramètres et en active 3,4 fois plus par jeton.

L'écart se creuse en revanche nettement sur les tâches de raisonnement pur : −12,8 points sur HLE.

C'est la signature d'un post-entraînement agentique très efficace sur un tronc plus petit — et la confirmation que la capacité brute, elle, se paie en paramètres.

Deux réserves d'usage

Toutes ces valeurs sont mesurées par Qwen. Deux des treize lignes du tableau texte — QwenSWEBench, CoWorkBench — portent sur des benchmarks dont Qwen est aussi l'auteur, et le premier affiche justement le plus large écart favorable du tableau (79,0 contre 49,3 pour le prédécesseur).

Par ailleurs, aucune évaluation indépendante n'existe encore.

Tableaux intégraux : Le tableau officiel.


Ce qui change par rapport au Max

Trois différences, toutes en faveur du petit.

Qwen3.8-Max Qwen3.8-27B
Licence maison, à seuils, non OSI Apache 2.0
Modalités des poids texte seul texte, images, vidéo
Raisonnement forcé, non désactivable désactivable (enable_thinking: False)

Le modèle ouvert, c'est celui-ci

Le Max a fait l'événement industriel. Mais c'est le 27B qui est réellement ouvert au sens habituel du terme : licence permissive approuvée OSI, multimodalité conservée dans les poids, et contrôle rendu à l'utilisateur sur le mode de raisonnement.

Le paradoxe mérite d'être noté : le modèle le moins mis en avant est le plus ouvert des deux.


Ce qui reste inconnu

Sujet Statut
Recette d'entraînement non publiée
Jetons d'entraînement, données non publiés
Ablations justifiant le ratio 3:1 aucune
Évaluations indépendantes aucune à ce jour
Évaluation de sécurité aucune
Modèle de base non affiné non publié
Qualité au-delà de 262 144 jetons non mesurée

Voir Ce qui reste non publié.


Verdict

Le meilleur modèle local de sa taille au moment de sa sortie, selon les chiffres de son constructeur : multimodal, permissif, économe en cache, et remarquablement fort en agentique pour 27 milliards de paramètres.

Ses limites sont celles de sa génération : aucune documentation d'entraînement, aucune mesure indépendante, et un raisonnement pur qui reste loin des grands modèles.

Pour un usage local, c'est aujourd'hui le choix par défaut. Pour une décision engageante, attendez les premières évaluations tierces.