Ce qui est annoncé, ce qui est livré¶
Trois affirmations le 3 août. Trois vérifications le 14.
L'annonce du 3 août¶
Au lancement de Qwen3.8-Max, Alibaba annonce un second modèle : Qwen3.8-27B, destiné lui aussi à sortir en poids ouverts, dans le même délai.
Trois affirmations, et c'était tout :
| # | Affirmation |
|---|---|
| 1 | Le modèle compte environ 27 milliards de paramètres |
| 2 | Il est destiné au mono-GPU et à l'auto-hébergement |
| 3 | Ses poids seront ouverts |
Aucun benchmark, aucune spécification, aucune licence nommée.
Le communiqué institutionnel ne le mentionnait même pas
Le communiqué d'Alibaba Group du 3 août portait entièrement sur le Max. Le 27B n'y figurait pas : sa mention venait du billet technique de l'équipe Qwen.
Vérification 1 — « environ 27 milliards de paramètres »¶
Tenu, avec une précision utile.
Le décompte à partir de config.json donne :
| Composant | Paramètres |
|---|---|
| Modèle de langage | 26,896 G |
| Encodeur visuel | 0,461 G |
| Couche de prédiction multi-jetons | 0,372 G |
| Total | 27,729 G |
Hugging Face affiche l'étiquette « 28B ». Le nom commercial dit « 27B ». Les deux arrondissent le même nombre.
L'ambiguïté redoutée n'existait pas
La première édition de ce rapport signalait un risque réel : si le modèle avait été un Mixture-of-Experts, « 27B » aurait pu désigner les paramètres actifs, et le total aurait alors pesé 150 à 250 G — donc n'aurait pas tenu sur une carte.
config.json tranche : intermediate_size: 17408, aucun champ
num_experts. Le modèle est dense. « 27B » désigne bien le total.
Vérification 2 — « mono-GPU et auto-hébergement »¶
Tenu.
| Précision | Poids | Carte minimale pour charger |
|---|---|---|
| BF16 | 55,5 Go | H100 80 Go |
| FP8 | 27,7 Go | RTX 5090 32 Go |
| 4 bits | 13,9 Go | RTX 4090 24 Go |
Et le contexte réellement tenable est bien meilleur qu'un dense classique, grâce à l'attention hybride :
| Carte | Contexte en 4 bits |
|---|---|
| RTX 4090 (24 Go) | ~115 600 jetons |
| L40S (48 Go) | ~445 200 jetons |
La promesse est tenue au-delà du minimum
« Mono-GPU » aurait pu signifier « charge, mais avec 8 000 jetons de contexte ». Ce n'est pas le cas : une carte grand public tient plus de 100 000 jetons, et une carte professionnelle dépasse la fenêtre native.
Détail : L'arithmétique de la VRAM.
Vérification 3 — « poids ouverts »¶
Tenu, et mieux qu'attendu.
La première édition de ce rapport insistait sur un point : « poids ouverts » ne dit rien de la licence, et le seul précédent de la génération — Qwen3.8-Max — était sorti sous une licence maison à seuils commerciaux, non approuvée OSI.
Le dépôt affiche : apache-2.0.
Le risque principal du rapport ne s'est pas matérialisé
Aucun seuil d'utilisateurs, aucun seuil de revenu, aucune obligation d'attribution dans l'interface, aucune clause de Model-as-a-Service, aucune restriction géographique.
Une entreprise peut le déployer, le modifier, le redistribuer et le vendre sans consulter d'avocat.
Voir Le risque de licence, conservé pour la méthode.
Ce qui a été livré en plus¶
Trois choses qu'Alibaba n'avait pas annoncées, et qui comptent.
La multimodalité¶
config.json contient un bloc vision_config complet et
language_model_only: false. Le modèle accepte texte, images et vidéo.
C'est le contraire du Max, dont les poids ouverts sont textuels alors que son API ne l'est pas. Voir La voie visuelle.
Le raisonnement désactivable¶
La carte de modèle documente "enable_thinking": False, ainsi que
reasoning_effort réglable sur trois niveaux et un paramètre
preserve_thinking.
L'autre crainte levée
Dans les poids du Max, le raisonnement est forcé et ne peut pas être coupé. Sur un modèle local, où une carte grand public produit peut-être 30 jetons par seconde, trente mille jetons de réflexion représentent seize minutes avant le premier mot utile.
Le 27B rend ce contrôle à l'utilisateur. C'est, pour un usage local, l'un des choix les plus importants de la carte de modèle.
Une variante FP8 officielle¶
Qwen/Qwen3.8-27B-FP8, publiée en
même temps, et plus téléchargée que la BF16 — comme pour le Max.
Le bilan¶
| # | Annoncé | Livré | Verdict |
|---|---|---|---|
| 1 | ~27 G de paramètres | 27,729 G, dense | ✅ |
| 2 | Mono-GPU | tient sur 24 Go en 4 bits, ~115 600 jetons | ✅ |
| 3 | Poids ouverts | Apache 2.0 | ✅ au-delà de l'attendu |
| — | (non annoncé) | multimodal | 🎁 |
| — | (non annoncé) | raisonnement désactivable | 🎁 |
| — | (non annoncé) | variante FP8 officielle | 🎁 |
Une annonce pauvre, une livraison généreuse
Trois affirmations vagues le 3 août, sans le moindre chiffre de performance. Onze jours plus tard, un modèle qui fait tout ce qui était promis et trois choses qui ne l'étaient pas.
C'est l'inverse du schéma habituel, et cela mérite d'être noté au crédit d'Alibaba — même si le retard, lui, reste réel. Voir Chronologie.
À retenir¶
Ce chapitre en cinq points
- Les trois affirmations du 3 août sont tenues.
- « 27B » désigne bien le total : le modèle est dense, l'ambiguïté total/actifs n'existait pas.
- La licence est Apache 2.0 — le risque principal du rapport ne s'est pas matérialisé.
- Le modèle est multimodal, ce qui n'avait pas été annoncé.
- Le raisonnement est désactivable, contrairement à celui du Max.
Chapitre suivant : Chronologie.