Qwen3.8-27B : analyse complète¶
Alibaba · publié le 14 août 2026 · Apache 2.0 · dense, multimodal, hybride
Ce que contient cette recherche¶
Une analyse de Qwen3.8-27B, annoncé le 3 août 2026 en même temps que
Qwen3.8-Max, promis pour la semaine du 10, et
finalement publié le 14 août 2026 sous le nom
Qwen/Qwen3.8-27B.
C'est le membre de la gamme qui compte pour le plus grand nombre : le seul qu'on puisse réellement exécuter.
| Qwen3.8-Max | Qwen3.8-27B | |
|---|---|---|
| Poids | 4,89 To | 55,6 Go |
| Matériel minimal | 9 à 74 GPU | une carte de 24 Go |
| Licence | maison, à seuils | Apache 2.0 |
| Modalités des poids | texte seul | texte, images, vidéo |
| Raisonnement | forcé | désactivable |
Qwen3.8-27B en une phrase
Un modèle dense de 27,7 milliards de paramètres, nativement multimodal, bâti sur une alternance 3 couches d'attention linéaire pour 1 couche d'attention complète, avec 262 144 jetons de contexte natif extensibles à 1 000 000, publié sous Apache 2.0 — et qui bat son propre grand frère à 2,4 billions de paramètres sur plusieurs benchmarks agentiques.
| Objectif | Comprendre l'architecture réelle, vérifier les chiffres, et savoir ce que le modèle tient sur votre matériel |
| Public | Qui envisage de l'exécuter localement ou sur site — aucun prérequis |
| Volume | 8 parties, 26 chapitres |
| Durée de lecture | 2 h 30 pour l'ensemble · 15 min pour le résumé exécutif |
| Niveau | Débutant → avancé (les parties Architecture et Matériel montent à ★★★) |
| Créé le | 13 août 2026 |
| Dernière révision | 15 août 2026 — réédition après publication des poids |
Ce que cette recherche apporte¶
Des vérifications indépendantes, reproductibles
Un script en Python pur, sans dépendance,
part du seul config.json et reconstruit :
| Vérification | Calculé | Observé | Écart |
|---|---|---|---|
| Paramètres totaux | 27,729 G | étiquette « 28B » | 0,97 % |
| Taille du dépôt en BF16 | 55,46 Go | 55,6 Go | 0,26 % |
| Cache clé-valeur | 64 KiO/jeton | non publié | — |
L'accord à 0,26 % sur la taille du dépôt confirme au passage la présence de l'encodeur visuel (0,461 G) et de la couche de prédiction multi-jetons (0,372 G) dans les poids livrés — deux éléments que la carte de modèle ne chiffre pas.
Le chiffre que personne ne publie
Seules 16 des 64 couches produisent un cache clé-valeur. Le calcul donne 17,18 Go à 262 144 jetons, contre 68,72 Go qu'exigerait la même architecture en attention complète : 75 % d'économie.
C'est ce qui permet à une RTX 4090 en 4 bits de tenir 115 000 jetons de contexte là où une architecture classique en offrirait 31 000.
Voir Contexte et cache.
Une particularité de ce rapport : les prédictions sont notées
La première édition de ce rapport, écrite avant la publication, formulait des hypothèses d'architecture chiffrées. Elles n'ont pas été effacées : elles sont confrontées aux faits, réussites et erreurs comprises, dans Le verdict des hypothèses.
Sur douze prédictions : neuf se vérifient exactement, deux à peu près, et une était fausse — la crainte d'un raisonnement forcé, qui ne s'est pas matérialisée.
Les huit parties¶
État des lieux — 3 chapitres¶
Ce qui a été annoncé et ce qui a été livré, la chronologie complète d'une promesse tenue avec quatre jours de retard, et ce qui reste non publié.
~30 min · ★☆☆
Architecture — 4 chapitres¶
Le cœur du rapport. La structure hybride 3:1, l'attention complète gatée, la
voie visuelle native, et l'arithmétique du contexte long — tout reconstruit
depuis config.json.
~45 min · ★★★
Évaluations — 2 chapitres¶
Les deux tableaux officiels — texte et vision-langage — reproduits intégralement, puis lus avec les réserves d'usage.
~25 min · ★★☆
Les déductions, confrontées aux faits — 3 chapitres¶
Le prédécesseur Qwen3.6-27B, la comparaison avec Qwen3.8-Max, et le verdict des hypothèses formulées avant la sortie.
~30 min · ★★☆
Matériel — 3 chapitres¶
Ce que le modèle tient réellement sur chaque carte, le coût du cache, et la quantification.
~30 min · ★★★
Utilisation — 2 chapitres¶
Comment le servir correctement, et le calcul auto-hébergement contre API.
~25 min · ★★☆
Analyse critique — 2 chapitres¶
Forces, limites, et le tableau des niveaux de preuve.
~20 min · ★★☆
Annexes — 4 pages¶
Glossaire, tableau complet des spécifications, vérification pas à pas, sources.
Référence
Avertissements méthodologiques¶
Aucun rapport technique n'existe
Comme pour le Max, il n'y a ni papier, ni rapport technique, ni recette
d'entraînement. Tout ce que ce rapport dit de précis sur l'architecture
vient de config.json et de la carte de modèle.
Les benchmarks du tableau officiel sont mesurés par Qwen
Ce ne sont pas des évaluations indépendantes, et deux des treize lignes du tableau texte portent sur des benchmarks dont Qwen est aussi l'auteur. Voir Lecture critique.
Aucune évaluation indépendante n'existe encore
Un jour après la publication, ni Artificial Analysis ni Vals AI n'ont publié de mesure. Les seuls chiffres disponibles sont ceux de Qwen.
Sources principales¶
| Source | Nature |
|---|---|
Qwen/Qwen3.8-27B |
Poids, config.json, licence, carte de modèle — source primaire |
config.json |
Toute l'architecture |
Qwen/Qwen3.8-27B-FP8 |
Variante officielle FP8 |
| Billet officiel Qwen3.8 | L'annonce du 3 août |
| Qwen3.8-Max | Le grand frère — base des comparaisons |
Liste complète : Sources.
Voir aussi¶
- Qwen3.8-Max — le grand frère, 2,42 T de paramètres, publié deux jours plus tôt sous licence maison.
- Kimi K3 — le concurrent en poids ouverts, documenté par un vrai rapport technique.