Aller au contenu

Résultats sur les benchmarks publics

Rappel méthodologique

Tous les chiffres de cette page proviennent du tableau 2 du rapport technique, produit par Moonshot AI. Ce ne sont pas des mesures indépendantes, sauf mention explicite. Lire d'abord Comprendre les benchmarks.

Configuration : Kimi K3 à effort max, température 1,0. Gras = meilleur, souligné dans le rapport = second.

Raisonnement et connaissance

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2
GPQA Diamond 93,5 92,6 94,1 91,0 93,5 91,2
CritPt 23,4 28,6 32,3 20,9 27,1 20,9
AA-LCR 74,7 70,0 73,7 67,7 74,3 71,3
HLE-Full (sans / avec outils) 43,5 / 56,0 53,3 / 63,0 44,5 / 58,0 49,8 / 57,9 41,4 / 52,2 —

Le point faible le plus net

Sur CritPt (physique de niveau recherche), Kimi K3 obtient 23,4 % contre 32,3 % pour GPT-5.6 Sol — soit 9 points d'écart. Il est également derrière GPT-5.5 (27,1) et Claude Fable 5 (28,6).

Sur HLE-Full, il est derrière Fable 5 et Sol, avec ou sans outils.

Le rapport le reconnaît explicitement : research-level reasoning remains a key direction for improvement.

En contrepartie

Sur GPQA Diamond (raisonnement scientifique de niveau doctoral), K3 est à 0,6 point du meilleur. Sur AA-LCR (raisonnement à long contexte, mesuré par Artificial Analysis), il est premier.

L'image est cohérente : excellent sur le raisonnement structuré et à long contexte, en retrait sur le raisonnement de recherche ouvert.

Codage

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2
DeepSWE 67,5 70,0 73,0 59,0 67,0 46,2
ProgramBench 77,8 76,8 77,6 71,9 70,8 63,7
Terminal-Bench 2.1 88,3 88,0 88,8 84,6 83,4 82,7
FrontierSWE 81,2 86,6 71,3 66,7 64,9 67,3
SWE-Marathon 42,0 35,0 39,0 40,0 14,0 13,0
PostTrainBench 36,6 41,4 34,6 34,1 28,4 34,3
MLS-Bench-Lite 48,3 49,9 46,2 42,8 35,5 40,4
SciCode 58,7 60,2 56,1 53,5 56,1 50,5

Les points forts

  • ProgramBench : premier (77,8).
  • SWE-Marathon (suite orientée noyaux GPU) : 42,0, soit 7 points devant Claude Fable 5. C'est le résultat de codage le plus net, cohérent avec le RL massif sur les tâches de noyaux.
  • Terminal-Bench 2.1 : 88,3 contre 88,8 — quasi égalité avec le meilleur.
  • FrontierSWE (long horizon) : deuxième avec 81,2, 10 points devant GPT-5.6 Sol (71,3).

Les réserves

  • SWE-Marathon est évalué sur une branche recalibrée pour H20, et Claude Fable 5 y atteint des replis sur 35 % des tâches. Les 7 points d'avance sont donc à interpréter avec prudence.
  • PostTrainBench est évalué sur H20 au lieu de H100.
  • DeepSWE : K3 est troisième, derrière les deux leaders.

Agentique

C'est l'axe où Kimi K3 est le plus fort.

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2
BrowseComp 91,2 88,0 90,4 84,3 84,4 —
DeepSearchQA (F1) 95,0 94,2 — 93,1 — —
ResearchRubrics 76,2 — 73,8 73,5 64,0 71,1
GDPval-AA v2 (Elo) 1 686 1 747 1 736 1 593 1 491 1 510
Toolathlon-Verified 76,5 77,9 74,9 76,2 73,5 59,9
MCPMark-Verified 94,5 87,4 92,9 76,4 92,9 —
MCP-Atlas 84,2 84,7 83,6 83,6 82,8 82,6
AutomationBench 30,8 29,1 29,7 27,2 22,7 12,9
JobBench 54,3 57,4 45,4 48,4 38,3 43,4
AA-Briefcase (Elo) 1 548 1 583 1 495 1 354 1 158 1 260
Agents' Last Exam 28,3 25,7 † 29,6 27,0 26,6 20,4
APEX-Agents 41,0 43,3 39,9 39,4 38,5 35,6
OfficeQA Pro 63,3 69,9 63,2 63,9 60,9 41,4
SpreadsheetBench 2 34,8 34,7 32,4 31,6 29,1 28,1
OSWorld-Verified 84,8 85,0 83,0 83,4 79,0 —
OSWorld 2.0 58,3 66,1 62,6 55,7 49,5 —
SaaS-Bench 60,1 — 61,4 56,1 43,8 —
τ³-Banking 33,4 26,8 33,0 27,6 31,3 26,8
Harvey Lab-AA 94,6 93,6 87,2 91,1 86,3 91,0
CorpFin v2 71,6 71,8 64,4 66,7 68,4 66,1
Finance Agent v2 54,4 56,3 53,8 53,9 51,8 49,7
Legal Research Bench 44,2 49,5 48,1 43,8 40,4 31,3

† Sur le classement officiel d'Agents' Last Exam, l'entrée Claude Fable 5 tourne à effort xhigh avec 40 % des tâches annotées comme dégradées.

Huit premières places

BrowseComp (91,2), DeepSearchQA (95,0 F1), ResearchRubrics (76,2), MCPMark-Verified (94,5), AutomationBench (30,8), SpreadsheetBench 2 (34,8), τ³-Banking (33,4), Harvey Lab-AA (94,6).

Le profil est net : recherche d'information, usage d'outils et flux de travail professionnels structurés.

Les faiblesses agentiques

  • Suites Elo de travail de connaissance : troisième sur GDPval-AA v2, deuxième sur AA-Briefcase, toutes deux menées par Claude Fable 5.
  • Usage d'ordinateur difficile : OSWorld 2.0 (58,3 contre 66,1) et SaaS-Bench sont menés par Fable 5 ou Sol.
  • Legal Research Bench : 44,2 contre 49,5 — plus de 5 points d'écart.
  • OfficeQA Pro : 63,3 contre 69,9, un écart de 6,6 points.

Sur les écarts serrés — CorpFin v2 (71,6 contre 71,8) et OSWorld-Verified (84,8 contre 85,0) —, rappelons que 0,2 point est très probablement dans le bruit statistique.

Vision

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5
WorldVQA ForceAnswer 51,0 56,7 41,8 39,1 38,5
OmniDocBench 91,1 89,8 85,8 87,9 89,4
PerceptionBench 58,5 57,2 59,7 47,2 55,8
Video-MME (avec sous-titres) 90,0 — 89,5 86,0 89,3
MMVU 82,1 — 81,2 79,2 81,7
BabyVision (avec Python) 85,7 90,5 88,9 81,2 83,6
MMMU-Pro (sans / avec Python) 81,6 / 83,4 81,2 / 86,5 83,0 / 84,6 78,9 / 82,7 81,2 / 83,2
CharXiv (RQ) 84,8 / 91,3 88,9 / 93,5 84,6 / 89,1 80,5 / 89,9 84,1 / 89,0
Math-Vision 94,3 / 97,8 94,8 / 98,6 95,8 / 97,8 86,7 / 97,1 92,2 / 96,8
ZeroBench-main (pass@5) 23,0 / 41,0 23,0 / 46,0 17,0 / 35,0 17,0 / 34,0 22,0 / 41,0

L'effet des outils Python

L'amplification par outil est spectaculaire et cohérente avec le RL de raisonnement visuel en boucle :

Banc Sans Python Avec Python Gain
ZeroBench-main 23,0 41,0 +18,0
Math-Vision 94,3 97,8 +3,5
MMMU-Pro 81,6 83,4 +1,8
CharXiv (RQ) 84,8 91,3 +6,5

C'est le bénéfice direct des environnements où le modèle recadre, zoome et calcule sur les images.

Premier sur trois bancs vision

OmniDocBench (91,1) — compréhension de documents, le domaine où l'entraînement OCR et le ViT depuis zéro devraient payer. Video-MME (90,0) et MMVU (82,1) — compréhension vidéo.

En retrait

WorldVQA : 51,0 contre 56,7 pour Fable 5, malgré une deuxième place très au-dessus de Sol (41,8). Le rapport note un « comportement de refus cohérent entre modèles » sur ce banc, contourné par ingénierie d'invite. CharXiv et BabyVision restent menés par Fable 5.

Synthèse

Le profil de Kimi K3, en trois lignes

Force : agents, recherche d'information, outillage, code long-horizon, documents, vidéo, développement web.

Parité : raisonnement scientifique structuré, usage d'ordinateur standard, mathématiques visuelles.

Faiblesse : raisonnement de niveau recherche (CritPt, HLE), travail de connaissance jugé par Elo, usage d'ordinateur difficile, recherche juridique.


Chapitre précédent : Comprendre les benchmarks · Chapitre suivant : Benchmarks internes