Aller au contenu

Qwen3.8-27B : analyse complète

Alibaba · publié le 14 août 2026 · Apache 2.0 · dense, multimodal, hybride


Ce que contient cette recherche

Une analyse de Qwen3.8-27B, annoncé le 3 août 2026 en même temps que Qwen3.8-Max, promis pour la semaine du 10, et finalement publié le 14 août 2026 sous le nom Qwen/Qwen3.8-27B.

C'est le membre de la gamme qui compte pour le plus grand nombre : le seul qu'on puisse réellement exécuter.

Qwen3.8-Max Qwen3.8-27B
Poids 4,89 To 55,6 Go
Matériel minimal 9 à 74 GPU une carte de 24 Go
Licence maison, à seuils Apache 2.0
Modalités des poids texte seul texte, images, vidéo
Raisonnement forcé désactivable

Qwen3.8-27B en une phrase

Un modèle dense de 27,7 milliards de paramètres, nativement multimodal, bâti sur une alternance 3 couches d'attention linéaire pour 1 couche d'attention complète, avec 262 144 jetons de contexte natif extensibles à 1 000 000, publié sous Apache 2.0 — et qui bat son propre grand frère à 2,4 billions de paramètres sur plusieurs benchmarks agentiques.

Objectif Comprendre l'architecture réelle, vérifier les chiffres, et savoir ce que le modèle tient sur votre matériel
Public Qui envisage de l'exécuter localement ou sur site — aucun prérequis
Volume 8 parties, 26 chapitres
Durée de lecture 2 h 30 pour l'ensemble · 15 min pour le résumé exécutif
Niveau Débutant → avancé (les parties Architecture et Matériel montent à ★★★)
Créé le 13 août 2026
Dernière révision 15 août 2026 — réédition après publication des poids

Ce que cette recherche apporte

Des vérifications indépendantes, reproductibles

Un script en Python pur, sans dépendance, part du seul config.json et reconstruit :

Vérification Calculé Observé Écart
Paramètres totaux 27,729 G étiquette « 28B » 0,97 %
Taille du dépôt en BF16 55,46 Go 55,6 Go 0,26 %
Cache clé-valeur 64 KiO/jeton non publié —

L'accord à 0,26 % sur la taille du dépôt confirme au passage la présence de l'encodeur visuel (0,461 G) et de la couche de prédiction multi-jetons (0,372 G) dans les poids livrés — deux éléments que la carte de modèle ne chiffre pas.

Le chiffre que personne ne publie

Seules 16 des 64 couches produisent un cache clé-valeur. Le calcul donne 17,18 Go à 262 144 jetons, contre 68,72 Go qu'exigerait la même architecture en attention complète : 75 % d'économie.

C'est ce qui permet à une RTX 4090 en 4 bits de tenir 115 000 jetons de contexte là où une architecture classique en offrirait 31 000.

Voir Contexte et cache.

Une particularité de ce rapport : les prédictions sont notées

La première édition de ce rapport, écrite avant la publication, formulait des hypothèses d'architecture chiffrées. Elles n'ont pas été effacées : elles sont confrontées aux faits, réussites et erreurs comprises, dans Le verdict des hypothèses.

Sur douze prédictions : neuf se vérifient exactement, deux à peu près, et une était fausse — la crainte d'un raisonnement forcé, qui ne s'est pas matérialisée.


Les huit parties

État des lieux — 3 chapitres

Ce qui a été annoncé et ce qui a été livré, la chronologie complète d'une promesse tenue avec quatre jours de retard, et ce qui reste non publié.

~30 min · ★☆☆

Architecture — 4 chapitres

Le cœur du rapport. La structure hybride 3:1, l'attention complète gatée, la voie visuelle native, et l'arithmétique du contexte long — tout reconstruit depuis config.json.

~45 min · ★★★

Évaluations — 2 chapitres

Les deux tableaux officiels — texte et vision-langage — reproduits intégralement, puis lus avec les réserves d'usage.

~25 min · ★★☆

Les déductions, confrontées aux faits — 3 chapitres

Le prédécesseur Qwen3.6-27B, la comparaison avec Qwen3.8-Max, et le verdict des hypothèses formulées avant la sortie.

~30 min · ★★☆

Matériel — 3 chapitres

Ce que le modèle tient réellement sur chaque carte, le coût du cache, et la quantification.

~30 min · ★★★

Utilisation — 2 chapitres

Comment le servir correctement, et le calcul auto-hébergement contre API.

~25 min · ★★☆

Analyse critique — 2 chapitres

Forces, limites, et le tableau des niveaux de preuve.

~20 min · ★★☆

Annexes — 4 pages

Glossaire, tableau complet des spécifications, vérification pas à pas, sources.

Référence


Avertissements méthodologiques

Aucun rapport technique n'existe

Comme pour le Max, il n'y a ni papier, ni rapport technique, ni recette d'entraînement. Tout ce que ce rapport dit de précis sur l'architecture vient de config.json et de la carte de modèle.

Les benchmarks du tableau officiel sont mesurés par Qwen

Ce ne sont pas des évaluations indépendantes, et deux des treize lignes du tableau texte portent sur des benchmarks dont Qwen est aussi l'auteur. Voir Lecture critique.

Aucune évaluation indépendante n'existe encore

Un jour après la publication, ni Artificial Analysis ni Vals AI n'ont publié de mesure. Les seuls chiffres disponibles sont ceux de Qwen.


Sources principales

Source Nature
Qwen/Qwen3.8-27B Poids, config.json, licence, carte de modèle — source primaire
config.json Toute l'architecture
Qwen/Qwen3.8-27B-FP8 Variante officielle FP8
Billet officiel Qwen3.8 L'annonce du 3 août
Qwen3.8-Max Le grand frère — base des comparaisons

Liste complète : Sources.


Voir aussi

  • Qwen3.8-Max — le grand frère, 2,42 T de paramètres, publié deux jours plus tôt sous licence maison.
  • Kimi K3 — le concurrent en poids ouverts, documenté par un vrai rapport technique.