Comprendre les benchmarks¶
Ce que mesure chaque nom du tableau, et les quatre raisons pour lesquelles deux scores peuvent être incomparables.
Les familles présentes dans le tableau officiel¶
Codage à l'échelle du dépôt¶
| Nom | Ce qu'il mesure |
|---|---|
| SWE-bench Pro | résoudre de vraies issues GitHub dans de vrais dépôts ; le correctif doit faire passer les tests |
| FrontierSWE | variante plus difficile, sur des dépôts moins présents dans les données d'entraînement |
| DeepSWE 1.1 | tâches de génie logiciel à long horizon |
| NL2Repo-Bench | produire un dépôt entier à partir d'une description en langue naturelle |
Ce sont les benchmarks les plus proches d'un usage réel de développement, et les plus durs. C'est aussi la famille où Qwen3.8-Max décroche le plus nettement.
Agents et terminal¶
| Nom | Ce qu'il mesure |
|---|---|
| Terminal-Bench 2.1 | accomplir des tâches dans un vrai terminal, sur plusieurs tours |
| OSWorld-Verified | piloter un système d'exploitation complet — souris, fenêtres, applications |
| AndroidBench | piloter un appareil Android |
| Toolathlon Verified | appel d'outils sur des chaînes longues |
| Automation-Bench | automatisation de tâches, mesuré en pass@1 |
| Agents' Last Exam | agrégat de tâches agentiques très difficiles |
Travail de bureau — la catégorie maison¶
| Nom | Statut |
|---|---|
| CoWorkBench | conçu par Qwen |
| WorkSpaceBench | conçu par Qwen |
| JobBench | conçu par Qwen |
| SkillsBench | conçu par Qwen |
| QwenSWEBench, QwenQoderBench | conçus par Qwen |
| QwenReactBench, QwenSVGBench | conçus par Qwen, notés en Elo |
Huit lignes sur trente et une
En comptant large, huit des trente et une lignes du tableau portent sur des benchmarks dont Qwen est l'auteur.
Créer un benchmark, c'est décider de ce qui compte. Un modèle qui gagne sur le benchmark de son créateur n'a établi qu'une chose : l'équipe a optimisé ce qu'elle mesure.
Ces lignes doivent être lues comme du positionnement, pas comme de la mesure comparative.
Raisonnement et connaissances¶
| Nom | Ce qu'il mesure |
|---|---|
| GPQA Diamond | questions de sciences de niveau doctorat, à choix multiple |
| HLE (Humanity's Last Exam) | questions expertes conçues pour résister aux modèles |
| HLE w/ tools | idem, avec accès à des outils |
| IFBench | respect d'instructions complexes et contraignantes |
Domaines spécialisés¶
| Nom | Domaine |
|---|---|
| PaperBench | reproduction de travaux de recherche |
| MLS-Bench-Lite | apprentissage automatique appliqué |
| HealthBench | santé |
| PLawBench, PRBench-Legal | droit |
| PRBench-Finance | finance |
| $OneMillion-Bench | tâches expertes rémunérées, notées par des experts |
| WideSearch | recherche d'information à large couverture |
Long contexte¶
| Nom | Ce qu'il mesure |
|---|---|
| MRCR v2 256K (8 aiguilles) | retrouver 8 informations précises dans 256 000 jetons |
| LongBench v2 | compréhension de documents longs |
Aucun benchmark n'évalue au-delà de 256 K
Le modèle revendique 1 010 000 jetons. Le benchmark long contexte le plus exigeant du tableau s'arrête à 256 K — c'est-à-dire dans le contexte natif de 262 144.
La capacité annoncée d'un million de jetons n'est mesurée nulle part.
Les quatre pièges¶
Piège 1 — Le harnais¶
Un modèle qui résout des issues GitHub ne le fait pas seul. Il opère dans un harnais : la boucle qui lui donne des outils, gère les erreurs, décide quand s'arrêter et combien de tentatives autoriser.
Comparer deux scores obtenus avec deux harnais différents n'est pas comparer deux modèles
Un même modèle peut varier de vingt points selon le harnais. Le tableau de Qwen ne précise pas quel harnais a servi pour chaque colonne.
C'est la source d'incomparabilité la plus fréquente, et elle explique probablement une partie de l'écart de 19 points sur Terminal-Bench 2.1 entre le tableau officiel et les relevés indépendants.
Piège 2 — L'effort de raisonnement¶
Les modèles de 2026 se règlent : low, medium, high, xhigh, max. Un
même modèle à max peut dépasser de dix points sa propre version à medium —
en consommant dix fois plus de jetons et de temps.
Qwen3.8-Max est réglé à xhigh par défaut. Le tableau ne précise pas le réglage
des concurrents. Une colonne « Fable 5 » à effort standard face à une colonne
Qwen à xhigh n'est pas une comparaison honnête, sans que rien n'indique que ce
soit le cas ici.
Piège 3 — La contamination¶
Un benchmark public finit dans les données d'entraînement. Les issues GitHub de SWE-bench sont publiques depuis 2023. Un modèle entraîné en 2026 les a probablement vues.
C'est la raison d'être des variantes « Pro », « Verified » et « Frontier » : des tâches plus récentes ou filtrées. Ce n'est pas une garantie, seulement une atténuation.
Piège 4 — Le nombre d'items¶
| Benchmark | Items (ordre de grandeur) | Un point vaut… |
|---|---|---|
| AIME24 | 30 | 0,33 question |
| GPQA Diamond | 198 | 2 questions |
| SWE-bench Pro | ~700 | 7 tâches |
L'exemple d'AIME24
Qwen revendique un gain de +2,7 points sur AIME24 lors de la reproduction d'un article. Sur 30 questions, cela représente 0,8 question.
Changer la graine aléatoire de l'échantillonnage produit des écarts du même ordre. Cette revendication ne peut pas porter le poids qu'on lui donne.
Ce que les benchmarks ne mesurent pas¶
| Dimension | Statut |
|---|---|
| Vitesse | absente du tableau officiel — mesurée par Artificial Analysis à 47 j/s |
| Coût par tâche | absent — mesuré à 1,13 $ |
| Fiabilité sur la durée | non mesurée |
| Sécurité | aucune évaluation publiée |
| Multilinguisme | aucun benchmark dédié dans le tableau |
| Contexte au-delà de 256 K | non mesuré |
La vitesse et le coût sont, en usage agentique réel, souvent plus déterminants que deux points de benchmark. Voir Évaluations indépendantes.
Comment lire le tableau qui suit¶
Trois règles simples :
- Ignorer les lignes
Qwen*Benchpour toute comparaison entre modèles. - Donner du poids aux défaites : un tableau qui montre son modèle perdre de 12 points sur SWE-bench Pro est plus crédible qu'un tableau où tout est vert.
- Ne comparer que les écarts larges. Un écart de 1 à 2 points sur un benchmark de 200 items est du bruit.
Chapitre suivant : Le tableau officiel.