Aller au contenu

Ce qui est annoncé, ce qui est livré

Trois affirmations le 3 août. Trois vérifications le 14.


L'annonce du 3 août

Au lancement de Qwen3.8-Max, Alibaba annonce un second modèle : Qwen3.8-27B, destiné lui aussi à sortir en poids ouverts, dans le même délai.

Trois affirmations, et c'était tout :

# Affirmation
1 Le modèle compte environ 27 milliards de paramètres
2 Il est destiné au mono-GPU et à l'auto-hébergement
3 Ses poids seront ouverts

Aucun benchmark, aucune spécification, aucune licence nommée.

Le communiqué institutionnel ne le mentionnait même pas

Le communiqué d'Alibaba Group du 3 août portait entièrement sur le Max. Le 27B n'y figurait pas : sa mention venait du billet technique de l'équipe Qwen.


Vérification 1 — « environ 27 milliards de paramètres »

Tenu, avec une précision utile.

Le décompte à partir de config.json donne :

Composant Paramètres
Modèle de langage 26,896 G
Encodeur visuel 0,461 G
Couche de prédiction multi-jetons 0,372 G
Total 27,729 G

Hugging Face affiche l'étiquette « 28B ». Le nom commercial dit « 27B ». Les deux arrondissent le même nombre.

L'ambiguïté redoutée n'existait pas

La première édition de ce rapport signalait un risque réel : si le modèle avait été un Mixture-of-Experts, « 27B » aurait pu désigner les paramètres actifs, et le total aurait alors pesé 150 à 250 G — donc n'aurait pas tenu sur une carte.

config.json tranche : intermediate_size: 17408, aucun champ num_experts. Le modèle est dense. « 27B » désigne bien le total.


Vérification 2 — « mono-GPU et auto-hébergement »

Tenu.

Précision Poids Carte minimale pour charger
BF16 55,5 Go H100 80 Go
FP8 27,7 Go RTX 5090 32 Go
4 bits 13,9 Go RTX 4090 24 Go

Et le contexte réellement tenable est bien meilleur qu'un dense classique, grâce à l'attention hybride :

Carte Contexte en 4 bits
RTX 4090 (24 Go) ~115 600 jetons
L40S (48 Go) ~445 200 jetons

La promesse est tenue au-delà du minimum

« Mono-GPU » aurait pu signifier « charge, mais avec 8 000 jetons de contexte ». Ce n'est pas le cas : une carte grand public tient plus de 100 000 jetons, et une carte professionnelle dépasse la fenêtre native.

Détail : L'arithmétique de la VRAM.


Vérification 3 — « poids ouverts »

Tenu, et mieux qu'attendu.

La première édition de ce rapport insistait sur un point : « poids ouverts » ne dit rien de la licence, et le seul précédent de la génération — Qwen3.8-Max — était sorti sous une licence maison à seuils commerciaux, non approuvée OSI.

Le dépôt affiche : apache-2.0.

Le risque principal du rapport ne s'est pas matérialisé

Aucun seuil d'utilisateurs, aucun seuil de revenu, aucune obligation d'attribution dans l'interface, aucune clause de Model-as-a-Service, aucune restriction géographique.

Une entreprise peut le déployer, le modifier, le redistribuer et le vendre sans consulter d'avocat.

Voir Le risque de licence, conservé pour la méthode.


Ce qui a été livré en plus

Trois choses qu'Alibaba n'avait pas annoncées, et qui comptent.

La multimodalité

config.json contient un bloc vision_config complet et language_model_only: false. Le modèle accepte texte, images et vidéo.

C'est le contraire du Max, dont les poids ouverts sont textuels alors que son API ne l'est pas. Voir La voie visuelle.

Le raisonnement désactivable

La carte de modèle documente "enable_thinking": False, ainsi que reasoning_effort réglable sur trois niveaux et un paramètre preserve_thinking.

L'autre crainte levée

Dans les poids du Max, le raisonnement est forcé et ne peut pas être coupé. Sur un modèle local, où une carte grand public produit peut-être 30 jetons par seconde, trente mille jetons de réflexion représentent seize minutes avant le premier mot utile.

Le 27B rend ce contrôle à l'utilisateur. C'est, pour un usage local, l'un des choix les plus importants de la carte de modèle.

Une variante FP8 officielle

Qwen/Qwen3.8-27B-FP8, publiée en même temps, et plus téléchargée que la BF16 — comme pour le Max.


Le bilan

# Annoncé Livré Verdict
1 ~27 G de paramètres 27,729 G, dense ✅
2 Mono-GPU tient sur 24 Go en 4 bits, ~115 600 jetons ✅
3 Poids ouverts Apache 2.0 ✅ au-delà de l'attendu
— (non annoncé) multimodal 🎁
— (non annoncé) raisonnement désactivable 🎁
— (non annoncé) variante FP8 officielle 🎁

Une annonce pauvre, une livraison généreuse

Trois affirmations vagues le 3 août, sans le moindre chiffre de performance. Onze jours plus tard, un modèle qui fait tout ce qui était promis et trois choses qui ne l'étaient pas.

C'est l'inverse du schéma habituel, et cela mérite d'être noté au crédit d'Alibaba — même si le retard, lui, reste réel. Voir Chronologie.


À retenir

Ce chapitre en cinq points

  1. Les trois affirmations du 3 août sont tenues.
  2. « 27B » désigne bien le total : le modèle est dense, l'ambiguïté total/actifs n'existait pas.
  3. La licence est Apache 2.0 — le risque principal du rapport ne s'est pas matérialisé.
  4. Le modèle est multimodal, ce qui n'avait pas été annoncé.
  5. Le raisonnement est désactivable, contrairement à celui du Max.

Chapitre suivant : Chronologie.