Ce qui reste non publié¶
La publication a levé dix inconnues. Sept subsistent.
Ce qui a été levé¶
Pour mémoire, voici les inconnues que la première édition de ce rapport listait, et leur sort :
| Inconnue au 13 août | Résolue le 14 août |
|---|---|
| Licence | Apache 2.0 |
| Dense ou MoE | dense (intermediate_size: 17408) |
| Type d'attention | hybride 3:1 |
| Fenêtre de contexte | 262 144 natif, 1 000 000 étendu |
| Modalités | texte, images, vidéo |
| Performances | 30 lignes de benchmarks |
| Paramètres exacts | 27,729 G (recalculés) |
| Mode raisonnement | désactivable |
| Nom du dépôt | Qwen/Qwen3.8-27B |
| Date de sortie | 14 août 2026 |
Dix sur dix. Tout ce qui bloquait une décision technique est désormais connu.
Ce qui reste inconnu¶
1. La recette d'entraînement — rien du tout¶
| Statut | aucun rapport technique, aucune publication |
| Ce que cela empêche | comprendre d'où viennent les gains, reproduire le modèle |
Inconnues complètes :
- nombre de jetons d'entraînement ;
- composition du mélange de données ;
- durée, matériel, coût ;
- méthode de post-entraînement — SFT, apprentissage par renforcement, distillation ;
- environnements agentiques utilisés ;
- méthode d'extension du contexte à 1 000 000 (YaRN est nommé, ses paramètres non).
C'est l'écart majeur avec Kimi K3
Kimi K3 s'accompagne d'un rapport technique de 80 pages documentant données, lois d'échelle, recette, apprentissage par renforcement, distillation et infrastructure.
Alibaba publie les poids mais pas la méthode, pour ses deux modèles de la génération 3.8. Du point de vue de la recherche, ce n'est pas le même geste — même si, du point de vue de l'utilisateur, une licence Apache 2.0 vaut beaucoup.
2. Les ablations — aucune¶
Rien ne justifie le ratio 3:1 plutôt que 2:1 ou 5:1, ni les 48 têtes de valeur contre 16 têtes de clé, ni les 27 couches de l'encodeur visuel.
Le gain agentique spectaculaire sur le prédécesseur — jusqu'à +36,8 points — n'est attribué à rien : ni à l'architecture, ni aux données, ni au post-entraînement.
3. Le long contexte — jamais mesuré¶
Le modèle revendique 262 144 jetons natifs et 1 000 000 étendus. Aucune des trente lignes de benchmarks n'évalue le long contexte.
La question la plus intéressante est celle qui n'est pas posée
L'attention linéaire est connue pour dégrader le rappel exact à longue distance. C'est le compromis fondamental de l'architecture hybride.
Qwen publie trente benchmarks et pas un seul RULER, MRCR ou LongBench. Le Max avait au moins une ligne MRCR v2 à 256 K.
Rien ne permet donc de savoir ce que vaut réellement ce modèle sur les contextes qui justifient son architecture.
4. La sécurité — aucune évaluation¶
Ni capacités cyber, ni risques biologiques ou chimiques, ni robustesse aux détournements. Pour un modèle sous Apache 2.0, téléchargeable par tous et exécutable sur une carte grand public, l'absence est notable.
Kimi K3 a été évalué par l'UK AI Security Institute et le NIST CAISI. Rien d'équivalent ici.
5. Le modèle de base — non publié¶
Seule la version instruite est disponible. Un modèle de base non affiné est le support le plus utile pour un affinage sur données propres, et c'est précisément l'usage que permet une taille de 27 G.
Le même choix avait été fait pour le Max.
6. La dégradation par quantification — non mesurée¶
La quasi-totalité des utilisateurs feront tourner ce modèle en 4 bits ou en FP8. Aucune mesure ne documente ce que chaque format coûte en qualité.
Voir Quantification.
7. Les évaluations indépendantes — aucune à ce jour¶
Un jour après la publication, ni Artificial Analysis, ni Vals AI, ni LMArena n'ont publié de mesure.
Celle-ci se résoudra vite
Contrairement aux six précédentes, cette absence est temporaire. Un modèle sous Apache 2.0, de 27 G, multimodal, qui tient sur une carte, sera mesuré par de nombreuses équipes dans les jours qui suivent.
C'est ce qu'il faut attendre avant toute décision engageante.
Récapitulatif¶
| # | Inconnue | Temporaire ? | Bloque |
|---|---|---|---|
| 1 | Recette d'entraînement | non | la reproduction, l'attribution des gains |
| 2 | Ablations | non | comprendre pourquoi ça marche |
| 3 | Long contexte | jusqu'à mesure tierce | la confiance dans la fenêtre annoncée |
| 4 | Sécurité | jusqu'à mesure tierce | l'évaluation du risque |
| 5 | Modèle de base | non | l'affinage à partir d'un tronc neutre |
| 6 | Dégradation par quantification | jusqu'à mesure tierce | le choix du format |
| 7 | Évaluations indépendantes | oui, quelques jours | toute décision engageante |
À retenir¶
Ce chapitre en cinq points
- La publication a levé dix inconnues sur dix parmi celles qui bloquaient une décision technique.
- Aucune information sur l'entraînement n'est publiée — écart majeur avec Kimi K3.
- Aucune ablation ne justifie les choix d'architecture.
- Le long contexte n'est mesuré nulle part, alors que c'est la raison d'être de l'architecture hybride.
- Les évaluations indépendantes manquent encore, mais c'est la seule absence qui se résoudra d'elle-même.
Partie suivante : Architecture.