Aller au contenu

Comprendre les benchmarks

Ce que mesure chaque nom du tableau, et les quatre raisons pour lesquelles deux scores peuvent être incomparables.


Les familles présentes dans le tableau officiel

Codage à l'échelle du dépôt

Nom Ce qu'il mesure
SWE-bench Pro résoudre de vraies issues GitHub dans de vrais dépôts ; le correctif doit faire passer les tests
FrontierSWE variante plus difficile, sur des dépôts moins présents dans les données d'entraînement
DeepSWE 1.1 tâches de génie logiciel à long horizon
NL2Repo-Bench produire un dépôt entier à partir d'une description en langue naturelle

Ce sont les benchmarks les plus proches d'un usage réel de développement, et les plus durs. C'est aussi la famille où Qwen3.8-Max décroche le plus nettement.

Agents et terminal

Nom Ce qu'il mesure
Terminal-Bench 2.1 accomplir des tâches dans un vrai terminal, sur plusieurs tours
OSWorld-Verified piloter un système d'exploitation complet — souris, fenêtres, applications
AndroidBench piloter un appareil Android
Toolathlon Verified appel d'outils sur des chaînes longues
Automation-Bench automatisation de tâches, mesuré en pass@1
Agents' Last Exam agrégat de tâches agentiques très difficiles

Travail de bureau — la catégorie maison

Nom Statut
CoWorkBench conçu par Qwen
WorkSpaceBench conçu par Qwen
JobBench conçu par Qwen
SkillsBench conçu par Qwen
QwenSWEBench, QwenQoderBench conçus par Qwen
QwenReactBench, QwenSVGBench conçus par Qwen, notés en Elo

Huit lignes sur trente et une

En comptant large, huit des trente et une lignes du tableau portent sur des benchmarks dont Qwen est l'auteur.

Créer un benchmark, c'est décider de ce qui compte. Un modèle qui gagne sur le benchmark de son créateur n'a établi qu'une chose : l'équipe a optimisé ce qu'elle mesure.

Ces lignes doivent être lues comme du positionnement, pas comme de la mesure comparative.

Raisonnement et connaissances

Nom Ce qu'il mesure
GPQA Diamond questions de sciences de niveau doctorat, à choix multiple
HLE (Humanity's Last Exam) questions expertes conçues pour résister aux modèles
HLE w/ tools idem, avec accès à des outils
IFBench respect d'instructions complexes et contraignantes

Domaines spécialisés

Nom Domaine
PaperBench reproduction de travaux de recherche
MLS-Bench-Lite apprentissage automatique appliqué
HealthBench santé
PLawBench, PRBench-Legal droit
PRBench-Finance finance
$OneMillion-Bench tâches expertes rémunérées, notées par des experts
WideSearch recherche d'information à large couverture

Long contexte

Nom Ce qu'il mesure
MRCR v2 256K (8 aiguilles) retrouver 8 informations précises dans 256 000 jetons
LongBench v2 compréhension de documents longs

Aucun benchmark n'évalue au-delà de 256 K

Le modèle revendique 1 010 000 jetons. Le benchmark long contexte le plus exigeant du tableau s'arrête à 256 K — c'est-à-dire dans le contexte natif de 262 144.

La capacité annoncée d'un million de jetons n'est mesurée nulle part.


Les quatre pièges

Piège 1 — Le harnais

Un modèle qui résout des issues GitHub ne le fait pas seul. Il opère dans un harnais : la boucle qui lui donne des outils, gère les erreurs, décide quand s'arrêter et combien de tentatives autoriser.

Comparer deux scores obtenus avec deux harnais différents n'est pas comparer deux modèles

Un même modèle peut varier de vingt points selon le harnais. Le tableau de Qwen ne précise pas quel harnais a servi pour chaque colonne.

C'est la source d'incomparabilité la plus fréquente, et elle explique probablement une partie de l'écart de 19 points sur Terminal-Bench 2.1 entre le tableau officiel et les relevés indépendants.

Piège 2 — L'effort de raisonnement

Les modèles de 2026 se règlent : low, medium, high, xhigh, max. Un même modèle à max peut dépasser de dix points sa propre version à medium — en consommant dix fois plus de jetons et de temps.

Qwen3.8-Max est réglé à xhigh par défaut. Le tableau ne précise pas le réglage des concurrents. Une colonne « Fable 5 » à effort standard face à une colonne Qwen à xhigh n'est pas une comparaison honnête, sans que rien n'indique que ce soit le cas ici.

Piège 3 — La contamination

Un benchmark public finit dans les données d'entraînement. Les issues GitHub de SWE-bench sont publiques depuis 2023. Un modèle entraîné en 2026 les a probablement vues.

C'est la raison d'être des variantes « Pro », « Verified » et « Frontier » : des tâches plus récentes ou filtrées. Ce n'est pas une garantie, seulement une atténuation.

Piège 4 — Le nombre d'items

Benchmark Items (ordre de grandeur) Un point vaut…
AIME24 30 0,33 question
GPQA Diamond 198 2 questions
SWE-bench Pro ~700 7 tâches

L'exemple d'AIME24

Qwen revendique un gain de +2,7 points sur AIME24 lors de la reproduction d'un article. Sur 30 questions, cela représente 0,8 question.

Changer la graine aléatoire de l'échantillonnage produit des écarts du même ordre. Cette revendication ne peut pas porter le poids qu'on lui donne.


Ce que les benchmarks ne mesurent pas

Dimension Statut
Vitesse absente du tableau officiel — mesurée par Artificial Analysis à 47 j/s
Coût par tâche absent — mesuré à 1,13 $
Fiabilité sur la durée non mesurée
Sécurité aucune évaluation publiée
Multilinguisme aucun benchmark dédié dans le tableau
Contexte au-delà de 256 K non mesuré

La vitesse et le coût sont, en usage agentique réel, souvent plus déterminants que deux points de benchmark. Voir Évaluations indépendantes.


Comment lire le tableau qui suit

Trois règles simples :

  1. Ignorer les lignes Qwen*Bench pour toute comparaison entre modèles.
  2. Donner du poids aux défaites : un tableau qui montre son modèle perdre de 12 points sur SWE-bench Pro est plus crédible qu'un tableau où tout est vert.
  3. Ne comparer que les écarts larges. Un écart de 1 à 2 points sur un benchmark de 200 items est du bruit.

Chapitre suivant : Le tableau officiel.