Forces et limites¶
Ce que le modèle réussit, ce qui lui manque — et le retour sur le risque de licence.
Les forces¶
1. Le saut sur le prédécesseur est considérable¶
C'est la mesure la plus solide du dossier : deux modèles de même taille, de la même maison, évalués par la même équipe.
| Domaine | Gain |
|---|---|
| Raisonnement visuel (BabyVision) | +36,8 |
| Codage agentique (DeepSWE) | +28,9 |
| Usage d'ordinateur (OSWorld) | +20,4 |
| Usage du navigateur (WebArena) | +16,0 |
| Respect d'instructions (IFBench) | +10,4 |
| Raisonnement pur (GPQA) | +1,4 |
Sur l'agentique, c'est un changement de catégorie
Passer de 13,3 à 42,2 sur DeepSWE, ou de 63,9 à 84,3 sur OSWorld, ce n'est pas une amélioration incrémentale. C'est un modèle qui devient utilisable là où le précédent échouait.
2. Le cache est quatre fois plus léger¶
L'attention hybride 3:1 ramène le cache de 68,72 Go à 17,18 Go au contexte natif.
Traduit en usage réel : une RTX 4090 en 4 bits passe d'environ 31 000 à 115 600 jetons utilisables.
C'est ce qui distingue un modèle local utilisable d'un modèle frustrant
Trente mille jetons, c'est une conversation. Cent quinze mille, c'est un dépôt de code.
3. Apache 2.0¶
Aucun seuil, aucune condition, aucune obligation d'attribution, aucune clause de Model-as-a-Service, aucune restriction géographique. Approuvée OSI.
4. La multimodalité est dans les poids¶
Texte, images et vidéo, pour 461 M de paramètres — 1,7 % du modèle.
Le Max, lui, publie des poids textuels alors que son API accepte les images. Ici, tout est livré.
5. Le raisonnement est désactivable¶
enable_thinking: False. Sur un modèle local, où chaque jeton coûte du temps
réel, c'est un contrôle décisif — et le Max ne l'offre pas.
6. Il talonne un modèle 88 fois plus gros¶
À 2 à 4 points de Qwen3.8-Max sur OSWorld, IFBench, GPQA et CoWorkBench.
7. L'écosystème a suivi immédiatement¶
GGUF, MLX, NVFP4, AWQ, variante FP8 officielle — dès le lendemain de la publication.
Les limites¶
1. Aucune documentation d'entraînement¶
| Élément | Kimi K3 | Qwen3.8-27B |
|---|---|---|
| Rapport technique | 80 pages, arXiv | aucun |
| Recette d'entraînement | détaillée | rien |
| Ablations | fournies | aucune |
| Évaluation de sécurité | oui | aucune |
On mesure le progrès, on ne sait pas d'où il vient
Les vingt à trente-sept points gagnés sur le prédécesseur ne viennent pas de l'attention hybride : passer une couche sur quatre en linéaire n'améliore pas, en soi, le pilotage d'un système d'exploitation.
Ils viennent des données et du post-entraînement. Ni l'un ni l'autre n'est documenté, et aucune ablation ne permet de les départager.
2. Le long contexte n'est mesuré nulle part¶
Trente lignes de benchmarks, pas un seul RULER, MRCR ou LongBench.
C'est la question la plus intéressante, et elle n'est pas posée
L'attention linéaire est connue pour dégrader le rappel exact à longue distance — c'est le compromis fondamental de l'architecture hybride.
Le modèle revendique 262 144 jetons natifs et 1 000 000 étendus, et rien ne permet de savoir ce qu'il y vaut. Le Max avait au moins une ligne MRCR à 256 K.
3. Aucune évaluation indépendante¶
Un jour après la publication, ni Artificial Analysis, ni Vals AI, ni LMArena n'ont publié de mesure. Tous les chiffres disponibles viennent d'Alibaba.
C'est la seule limite qui se résoudra d'elle-même, sous quelques jours.
4. Le raisonnement pur ne progresse pas¶
+1,4 point sur GPQA Diamond, et le modèle reste à 12,8 points du Max sur HLE, à 9,2 points d'Opus 4.6 Max.
Ce n'est pas un défaut, c'est une propriété d'échelle
Les capacités procédurales — cliquer, suivre un format, appeler un outil — saturent tôt et descendent bien vers les petits modèles. La connaissance encyclopédique et le raisonnement long continuent d'échelonner avec le nombre de paramètres.
Attendre d'un 27 G qu'il raisonne comme un 2 400 G est une erreur d'attente, pas une déception justifiée.
5. Rien sur la quantification¶
Presque tout le monde exécutera ce modèle en 4 bits ou en FP8. Aucune mesure ne documente ce que chaque format coûte.
6. Pas de modèle de base¶
Seule la version instruite est publiée, comme pour le Max. Un tronc non affiné serait le support le plus utile pour l'affinage — et c'est précisément l'usage que permet une taille de 27 G sous Apache 2.0.
7. Deux benchmarks maison sur trente¶
QwenSWEBench et CoWorkBench sont conçus par Qwen, et le premier affiche le
deuxième plus large écart favorable du tableau texte.
C'est nettement moins que les huit lignes sur trente et une du Max, mais cela reste à écarter de toute comparaison entre constructeurs.
Retour sur le risque de licence¶
C'était le danger principal identifié avant la publication, et il méritait un chapitre entier. Voici ce qu'il en reste.
Ce qui était craint¶
| Modèle | Licence |
|---|---|
| Qwen3.5, Qwen3.6-27B | Apache 2.0 |
| Qwen3.8-Max | maison, à seuils, non OSI |
| Qwen3.8-27B | inconnue |
Le seul précédent de la génération 3.8 était non permissif. Une rumeur d'interdiction géographique — États-Unis, UE, Royaume-Uni, Corée — circulait par ailleurs, alimentée par la licence réelle de MiniMax H3, sorti la même semaine.
Ce qui s'est passé¶
Apache 2.0. Aucun seuil, aucune restriction géographique, aucune obligation.
La prudence était justifiée, et elle n'a rien coûté
La recommandation était : « pour un projet qui démarre maintenant, utilisez Qwen3.6-27B, publié et sous Apache 2.0 ; migrez ensuite si la licence le permet. »
C'était la bonne décision a posteriori : le coût de l'attente était nul — le prédécesseur est excellent — et le risque évité était réel.
Un projet qui aurait parié sur Apache 2.0 avant l'annonce aurait eu raison. Mais il aurait eu raison par chance, et il aurait eu tort avec le Max.
Ce qu'il faut en retenir pour la suite¶
La règle reste valable pour le prochain modèle
« Poids ouverts » ne dit rien de la licence. Alibaba a publié, à deux jours d'intervalle, un modèle sous licence maison à seuils et un modèle sous Apache 2.0.
Lire le fichier LICENSE avant tout engagement reste la seule méthode
fiable. Cela prend dix secondes :
curl -s https://huggingface.co/<org>/<modele>/raw/main/LICENSE | head -20
À retenir¶
Ce chapitre en cinq points
- Le saut sur le prédécesseur est considérable sur l'agentique et le visuel — jusqu'à +36,8 points.
- L'hybride divise le cache par quatre, ce qui rend le contexte long accessible en local.
- Apache 2.0, multimodal, raisonnement désactivable : plus ouvert que le Max sur les trois points.
- Aucune documentation d'entraînement, aucune ablation, aucune évaluation indépendante, et le long contexte n'est mesuré nulle part.
- Le risque de licence ne s'est pas matérialisé, mais la prudence était justifiée et n'a rien coûté.
Chapitre suivant : Affirmations à vérifier.