Aller au contenu

Évaluations

Deux tableaux officiels, trente lignes, et aucune évaluation indépendante.


Le principe

Une règle, appliquée sans exception dans toute cette bibliothèque :

Un benchmark publié par le constructeur n'est pas une évaluation

Il n'est pas non plus un mensonge. C'est une mesure faite par une partie intéressée, dans des conditions qu'elle choisit, avec un harnais qu'elle contrôle, et publiée si elle est favorable.

Ces mesures indiquent ce que l'équipe a optimisé et ce qu'elle juge défendable. Elles n'établissent pas de comparaison contrôlée.

Et ici, il n'y a rien d'autre

Un jour après la publication, aucune évaluation indépendante n'existe : ni Artificial Analysis, ni Vals AI, ni LMArena n'ont publié de mesure sur ce modèle.

Tous les chiffres de cette partie viennent d'Alibaba.


Les deux chapitres

01 · Le tableau officiel

Les deux tableaux — texte et vision-langage — reproduits intégralement, avec les concurrents retenus par Qwen.

~15 min · ★★☆

02 · Lecture critique

Comment lire ces chiffres : les benchmarks maison, le choix des concurrents, l'effort de raisonnement, et ce qui n'est pas mesuré du tout.

~10 min · ★★☆


Le résultat en une phrase

Un saut massif sur l'agentique et l'usage d'ordinateur par rapport au prédécesseur — jusqu'à +36,8 points —, un progrès modeste sur le raisonnement pur, et un modèle qui talonne son grand frère 87 fois plus gros sur les tâches d'agent tout en restant loin derrière sur les tâches de connaissance.


Les concurrents retenus par Qwen

Modèle Nature Pourquoi il est là
Qwen3.6-27B prédécesseur direct, même taille la seule comparaison qui décide d'une migration
Qwen3.7-Plus modèle Qwen de gamme supérieure montre ce que la génération apporte à taille supérieure
Muse Glimmer-30B concurrent ouvert de taille voisine le comparable le plus direct hors maison
Opus 4.6 Max modèle propriétaire de tête la borne haute

Une sélection défendable

Comparer un 27 G à un prédécesseur de même taille et à un concurrent ouvert de 30 G est méthodologiquement correct.

L'inclusion d'Opus 4.6 Max sert évidemment la communication — un petit modèle qui bat parfois un grand fait un bon titre — mais les valeurs publiées montrent aussi les défaites, ce qui limite la critique. Voir Lecture critique.


Commencer : Le tableau officiel.