Aller au contenu

Questions ouvertes

Ce qu'on ne sait pas, ce qu'il faudrait pour le savoir, et ce qui mérite d'être surveillé.


Sur l'architecture

Pourquoi 3:1 ?

config.json dit full_attention_interval: 4. Il ne dit pas pourquoi.

Aucune ablation ne compare 2:1, 3:1, 5:1, ni une répartition variable selon la profondeur — les couches basses ayant possiblement moins besoin de rappel exact que les couches hautes.

Ce qu'il faudrait : une courbe de qualité en fonction du ratio, à budget de calcul constant. Publiée par Alibaba, ou reproduite sur un modèle jouet.

Pourquoi 512 experts de dimension 2 048 ?

À budget de paramètres constant, on pourrait avoir 256 experts de dimension 4 096, ou 1 024 de dimension 1 024. Le choix retenu est celui de la spécialisation maximale, mais rien ne dit qu'il soit optimal.

Avec 512 experts et 10 tirés par jeton, chaque expert ne voit qu'environ 2 % des jetons. Le risque de sous-entraînement est réel.

Ce qu'il faudrait : la distribution d'utilisation des experts sur un corpus de test. Elle se mesure sur les poids publiés, par quiconque a le matériel.

La couche MTP contient-elle bien un bloc MoE ?

L'accord à 0,04 % entre le calcul et la taille du dépôt le suggère fortement, mais une autre structure totalisant ~26 G donnerait le même résultat.

Ce qu'il faudrait : l'inspection de la liste des tenseurs du dépôt — un travail de quelques minutes pour qui télécharge l'index des safetensors.

Le coefficient d'équilibrage à 0,001

C'est bas. Soit Qwen utilise une correction de biais sans perte auxiliaire — une pratique répandue depuis 2024 — soit l'équipe accepte un déséquilibre.

Ce qu'il faudrait : la documentation de la recette d'entraînement, ou une mesure de la charge par expert à l'inférence.


Sur l'entraînement

Rien n'est publié. La liste des inconnues est donc la liste complète du sujet :

Question Statut
Nombre de jetons d'entraînement inconnu
Composition du mélange de données inconnue
Durée et matériel inconnus
Méthode de post-entraînement inconnue
Distillation depuis un modèle plus grand ? inconnu
Environnements d'apprentissage par renforcement inconnus
Méthode d'extension du contexte inconnue
Coût énergétique inconnu

Un modèle de 2,4 billions de paramètres sans une ligne sur son entraînement

C'est l'écart le plus net avec Kimi K3, dont le rapport technique de 80 pages documente données, lois d'échelle, recette, RL, distillation et infrastructure.

Alibaba publie les poids mais pas la méthode. Kimi publie les deux. Du point de vue de la recherche, ce n'est pas le même geste.


Sur les capacités

Que vaut le contexte au-delà de 262 144 jetons ?

Le modèle revendique 1 010 000. Rien n'est mesuré au-delà de 256 K.

Ce qu'il faudrait : une évaluation RULER ou MRCR à 512 K et 1 M, publiée par un tiers. C'est faisable dès aujourd'hui sur l'API.

C'est la question ouverte la plus importante du rapport : elle porte sur la caractéristique la plus mise en avant du modèle.

Le checkpoint se comporte-t-il comme l'API ?

Aucune évaluation indépendante ne porte sur les poids téléchargeables. Toutes mesurent le service d'Alibaba.

Les deux peuvent différer par le harnais, le format d'invite, le réglage d'effort, ou d'éventuels modules côté serveur.

Ce qu'il faudrait : qu'un laboratoire disposant du matériel évalue le checkpoint et publie l'écart. C'est le test le plus utile que la communauté puisse produire dans les semaines qui viennent.

D'où vient l'écart de 19 points sur Terminal-Bench 2.1 ?

Ce qu'il faudrait : une exécution documentée — version du harnais, effort de raisonnement, nombre de tentatives — par un tiers.


Sur la sécurité

Aucune évaluation publiée. Ni sur les capacités cyber, ni sur les risques biologiques ou chimiques, ni sur la robustesse aux détournements.

Un modèle de niveau frontière publié sans évaluation de risque

Plusieurs modèles concurrents s'accompagnent d'évaluations menées par des organismes indépendants — Kimi K3 a été évalué par l'UK AI Security Institute et le NIST CAISI.

Pour Qwen3.8-Max, il n'existe rien de tel. Le modèle est de niveau comparable et ses poids sont publics.

Ce qu'il faudrait : une évaluation par un organisme public. Il est possible qu'elle soit en cours ; à la date de rédaction, aucune n'est publiée.


Sur la stratégie

Pourquoi une licence maison plutôt qu'Apache 2.0 ?

Les lignées Qwen3.5 et Qwen3.6 étaient sous Apache 2.0. Le passage à une licence à seuils pour le modèle « Max » est un choix, pas un accident.

Lecture possible — et c'est une interprétation : Alibaba ouvre le modèle pour occuper le terrain, tout en se réservant un levier contractuel sur les concurrents qui voudraient le revendre comme service.

Ce qu'il faudrait : l'observation des licences des prochaines sorties de la gamme, à commencer par Qwen3.8-27B.

Qwen3.8-27B a répondu — et la réponse est instructive

Promis pour la semaine du 10 août, absent le 13, publié le 14 sous Apache 2.0.

C'est la meilleure indication disponible sur la politique de licence d'Alibaba :

Gamme Licence de la génération 3.8
Max maison, à seuils, non approuvée OSI
Moyenne (27B) Apache 2.0

La licence maison est une décision de gamme, pas de génération

C'était la question ouverte de ce chapitre, et elle est tranchée. Alibaba n'abandonne pas Apache 2.0 : il le réserve à ce qu'il donnait déjà, et encadre contractuellement le seul actif qu'il n'ouvrait pas jusqu'ici.

Le 27B est par ailleurs multimodal dans ses poids et son raisonnement est désactivable — deux choses que le Max ne fait pas.

Analyse complète : Qwen3.8-27B.


Ce qui mérite d'être surveillé

À surveiller Pourquoi
~~La sortie de Qwen3.8-27B et sa licence~~ résolu : publié le 14 août sous Apache 2.0
Une évaluation du checkpoint par un tiers seul moyen de savoir si les poids valent le service
Une mesure du contexte à 1 M la revendication phare, jamais testée
Une évaluation de sécurité absente, pour un modèle de ce niveau
Une reproduction de Terminal-Bench 2.1 19 points d'écart non expliqués
La distribution d'utilisation des experts mesurable sur les poids publics

À retenir

Ce chapitre en cinq points

  1. L'architecture est entièrement décrite mais nullement justifiée : aucune ablation.
  2. Rien n'est publié sur l'entraînement — c'est l'écart majeur avec Kimi K3.
  3. Le contexte au-delà de 262 144 jetons n'est mesuré nulle part.
  4. Aucune évaluation indépendante ne porte sur les poids, seulement sur l'API.
  5. Aucune évaluation de sécurité n'existe pour un modèle de niveau frontière à poids publics.

Partie suivante : Annexes.