Évaluations¶
Deux tableaux officiels, trente lignes, et aucune évaluation indépendante.
Le principe¶
Une règle, appliquée sans exception dans toute cette bibliothèque :
Un benchmark publié par le constructeur n'est pas une évaluation
Il n'est pas non plus un mensonge. C'est une mesure faite par une partie intéressée, dans des conditions qu'elle choisit, avec un harnais qu'elle contrôle, et publiée si elle est favorable.
Ces mesures indiquent ce que l'équipe a optimisé et ce qu'elle juge défendable. Elles n'établissent pas de comparaison contrôlée.
Et ici, il n'y a rien d'autre
Un jour après la publication, aucune évaluation indépendante n'existe : ni Artificial Analysis, ni Vals AI, ni LMArena n'ont publié de mesure sur ce modèle.
Tous les chiffres de cette partie viennent d'Alibaba.
Les deux chapitres¶
01 · Le tableau officiel¶
Les deux tableaux — texte et vision-langage — reproduits intégralement, avec les concurrents retenus par Qwen.
~15 min · ★★☆
02 · Lecture critique¶
Comment lire ces chiffres : les benchmarks maison, le choix des concurrents, l'effort de raisonnement, et ce qui n'est pas mesuré du tout.
~10 min · ★★☆
Le résultat en une phrase¶
Un saut massif sur l'agentique et l'usage d'ordinateur par rapport au prédécesseur — jusqu'à +36,8 points —, un progrès modeste sur le raisonnement pur, et un modèle qui talonne son grand frère 87 fois plus gros sur les tâches d'agent tout en restant loin derrière sur les tâches de connaissance.
Les concurrents retenus par Qwen¶
| Modèle | Nature | Pourquoi il est là |
|---|---|---|
| Qwen3.6-27B | prédécesseur direct, même taille | la seule comparaison qui décide d'une migration |
| Qwen3.7-Plus | modèle Qwen de gamme supérieure | montre ce que la génération apporte à taille supérieure |
| Muse Glimmer-30B | concurrent ouvert de taille voisine | le comparable le plus direct hors maison |
| Opus 4.6 Max | modèle propriétaire de tête | la borne haute |
Une sélection défendable
Comparer un 27 G à un prédécesseur de même taille et à un concurrent ouvert de 30 G est méthodologiquement correct.
L'inclusion d'Opus 4.6 Max sert évidemment la communication — un petit modèle qui bat parfois un grand fait un bon titre — mais les valeurs publiées montrent aussi les défaites, ce qui limite la critique. Voir Lecture critique.
Commencer : Le tableau officiel.