Aller au contenu

Les déductions, confrontées aux faits

Ce que le modèle doit à son prédécesseur, ce qu'il doit à son grand frère, et ce que valaient les prédictions faites avant sa sortie.


Une partie qui a changé de nature

Cette partie a été écrite le 13 août 2026, alors que Qwen3.8-27B n'existait pas publiquement. Elle formulait des hypothèses d'architecture à partir des deux modèles voisins, avec un degré de confiance explicite pour chacune.

Le modèle est sorti le 14. Ces hypothèses n'ont pas été effacées : elles sont confrontées aux faits, réussites et erreurs comprises.

Pourquoi conserver des prédictions plutôt que les remplacer

Un rapport qui efface ses hypothèses après coup ne peut plus être jugé. Un rapport qui les conserve permet de mesurer ce que vaut sa méthode.

Ici, la méthode a bien tenu — mais pas partout, et l'endroit où elle a échoué est instructif. Voir Le verdict des hypothèses.


Les trois chapitres

01 · Le précédent Qwen3.6-27B

Ce que le prédécesseur apportait, ce que le successeur en garde, et le saut mesuré entre les deux.

~10 min · ★★☆

02 · Face à Qwen3.8-Max

Deux modèles, une même recette, deux échelles. Ce qui est descendu, ce qui n'a pas pu descendre, et ce que le petit fait mieux que le grand.

~10 min · ★★☆

03 · Le verdict des hypothèses

Les douze prédictions formulées avant la sortie, notées une par une — y compris les deux approximations et l'erreur.

~10 min · ★★☆


Les trois modèles, côte à côte

Qwen3.6-27B Qwen3.8-27B Qwen3.8-Max
Sortie avril 2026 14 août 2026 12 août 2026
Paramètres ~27 G 27,73 G 2 446 G
Actifs / jeton ~27 G 27,73 G 95 G
Architecture dense dense MoE, 513 experts
Attention complète hybride 3:1 hybride 3:1
Couches 64 64 92
Dimension cachée 5 120 5 120 8 192
Contexte natif 262 144 262 144 262 144
Modalités texte, image, vidéo texte, image, vidéo texte seul
Licence Apache 2.0 Apache 2.0 maison, à seuils
Raisonnement réglable désactivable forcé
Poids ~54 Go 55,6 Go 4 890 Go

Le 27B ressemble davantage à son prédécesseur qu'à son grand frère

Même nombre de couches, même dimension cachée, même contexte, mêmes modalités, même licence.

La seule chose qu'il hérite du Max — mais elle est décisive — est l'attention hybride 3:1, qui divise son cache par quatre.


Commencer : Le précédent Qwen3.6-27B.