Résultats sur les benchmarks publics¶
Rappel méthodologique
Tous les chiffres de cette page proviennent du tableau 2 du rapport technique, produit par Moonshot AI. Ce ne sont pas des mesures indépendantes, sauf mention explicite. Lire d'abord Comprendre les benchmarks.
Configuration : Kimi K3 à effort max, température 1,0. Gras = meilleur,
souligné dans le rapport = second.
Raisonnement et connaissance¶
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| GPQA Diamond | 93,5 | 92,6 | 94,1 | 91,0 | 93,5 | 91,2 |
| CritPt | 23,4 | 28,6 | 32,3 | 20,9 | 27,1 | 20,9 |
| AA-LCR | 74,7 | 70,0 | 73,7 | 67,7 | 74,3 | 71,3 |
| HLE-Full (sans / avec outils) | 43,5 / 56,0 | 53,3 / 63,0 | 44,5 / 58,0 | 49,8 / 57,9 | 41,4 / 52,2 | — |
Le point faible le plus net
Sur CritPt (physique de niveau recherche), Kimi K3 obtient 23,4 % contre 32,3 % pour GPT-5.6 Sol — soit 9 points d'écart. Il est également derrière GPT-5.5 (27,1) et Claude Fable 5 (28,6).
Sur HLE-Full, il est derrière Fable 5 et Sol, avec ou sans outils.
Le rapport le reconnaît explicitement : research-level reasoning remains a key direction for improvement.
En contrepartie
Sur GPQA Diamond (raisonnement scientifique de niveau doctoral), K3 est à 0,6 point du meilleur. Sur AA-LCR (raisonnement à long contexte, mesuré par Artificial Analysis), il est premier.
L'image est cohérente : excellent sur le raisonnement structuré et à long contexte, en retrait sur le raisonnement de recherche ouvert.
Codage¶
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 | 67,0 | 46,2 |
| ProgramBench | 77,8 | 76,8 | 77,6 | 71,9 | 70,8 | 63,7 |
| Terminal-Bench 2.1 | 88,3 | 88,0 | 88,8 | 84,6 | 83,4 | 82,7 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 | 64,9 | 67,3 |
| SWE-Marathon | 42,0 | 35,0 | 39,0 | 40,0 | 14,0 | 13,0 |
| PostTrainBench | 36,6 | 41,4 | 34,6 | 34,1 | 28,4 | 34,3 |
| MLS-Bench-Lite | 48,3 | 49,9 | 46,2 | 42,8 | 35,5 | 40,4 |
| SciCode | 58,7 | 60,2 | 56,1 | 53,5 | 56,1 | 50,5 |
Les points forts
- ProgramBench : premier (77,8).
- SWE-Marathon (suite orientée noyaux GPU) : 42,0, soit 7 points devant Claude Fable 5. C'est le résultat de codage le plus net, cohérent avec le RL massif sur les tâches de noyaux.
- Terminal-Bench 2.1 : 88,3 contre 88,8 — quasi égalité avec le meilleur.
- FrontierSWE (long horizon) : deuxième avec 81,2, 10 points devant GPT-5.6 Sol (71,3).
Les réserves
- SWE-Marathon est évalué sur une branche recalibrée pour H20, et Claude Fable 5 y atteint des replis sur 35 % des tâches. Les 7 points d'avance sont donc à interpréter avec prudence.
- PostTrainBench est évalué sur H20 au lieu de H100.
- DeepSWE : K3 est troisième, derrière les deux leaders.
Agentique¶
C'est l'axe où Kimi K3 est le plus fort.
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 | 84,4 | — |
| DeepSearchQA (F1) | 95,0 | 94,2 | — | 93,1 | — | — |
| ResearchRubrics | 76,2 | — | 73,8 | 73,5 | 64,0 | 71,1 |
| GDPval-AA v2 (Elo) | 1 686 | 1 747 | 1 736 | 1 593 | 1 491 | 1 510 |
| Toolathlon-Verified | 76,5 | 77,9 | 74,9 | 76,2 | 73,5 | 59,9 |
| MCPMark-Verified | 94,5 | 87,4 | 92,9 | 76,4 | 92,9 | — |
| MCP-Atlas | 84,2 | 84,7 | 83,6 | 83,6 | 82,8 | 82,6 |
| AutomationBench | 30,8 | 29,1 | 29,7 | 27,2 | 22,7 | 12,9 |
| JobBench | 54,3 | 57,4 | 45,4 | 48,4 | 38,3 | 43,4 |
| AA-Briefcase (Elo) | 1 548 | 1 583 | 1 495 | 1 354 | 1 158 | 1 260 |
| Agents' Last Exam | 28,3 | 25,7 † | 29,6 | 27,0 | 26,6 | 20,4 |
| APEX-Agents | 41,0 | 43,3 | 39,9 | 39,4 | 38,5 | 35,6 |
| OfficeQA Pro | 63,3 | 69,9 | 63,2 | 63,9 | 60,9 | 41,4 |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 | 29,1 | 28,1 |
| OSWorld-Verified | 84,8 | 85,0 | 83,0 | 83,4 | 79,0 | — |
| OSWorld 2.0 | 58,3 | 66,1 | 62,6 | 55,7 | 49,5 | — |
| SaaS-Bench | 60,1 | — | 61,4 | 56,1 | 43,8 | — |
| τ³-Banking | 33,4 | 26,8 | 33,0 | 27,6 | 31,3 | 26,8 |
| Harvey Lab-AA | 94,6 | 93,6 | 87,2 | 91,1 | 86,3 | 91,0 |
| CorpFin v2 | 71,6 | 71,8 | 64,4 | 66,7 | 68,4 | 66,1 |
| Finance Agent v2 | 54,4 | 56,3 | 53,8 | 53,9 | 51,8 | 49,7 |
| Legal Research Bench | 44,2 | 49,5 | 48,1 | 43,8 | 40,4 | 31,3 |
† Sur le classement officiel d'Agents' Last Exam, l'entrée Claude Fable 5 tourne
à effort xhigh avec 40 % des tâches annotées comme dégradées.
Huit premières places
BrowseComp (91,2), DeepSearchQA (95,0 F1), ResearchRubrics (76,2), MCPMark-Verified (94,5), AutomationBench (30,8), SpreadsheetBench 2 (34,8), τ³-Banking (33,4), Harvey Lab-AA (94,6).
Le profil est net : recherche d'information, usage d'outils et flux de travail professionnels structurés.
Les faiblesses agentiques
- Suites Elo de travail de connaissance : troisième sur GDPval-AA v2, deuxième sur AA-Briefcase, toutes deux menées par Claude Fable 5.
- Usage d'ordinateur difficile : OSWorld 2.0 (58,3 contre 66,1) et SaaS-Bench sont menés par Fable 5 ou Sol.
- Legal Research Bench : 44,2 contre 49,5 — plus de 5 points d'écart.
- OfficeQA Pro : 63,3 contre 69,9, un écart de 6,6 points.
Sur les écarts serrés — CorpFin v2 (71,6 contre 71,8) et OSWorld-Verified (84,8 contre 85,0) —, rappelons que 0,2 point est très probablement dans le bruit statistique.
Vision¶
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| WorldVQA ForceAnswer | 51,0 | 56,7 | 41,8 | 39,1 | 38,5 |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 | 89,4 |
| PerceptionBench | 58,5 | 57,2 | 59,7 | 47,2 | 55,8 |
| Video-MME (avec sous-titres) | 90,0 | — | 89,5 | 86,0 | 89,3 |
| MMVU | 82,1 | — | 81,2 | 79,2 | 81,7 |
| BabyVision (avec Python) | 85,7 | 90,5 | 88,9 | 81,2 | 83,6 |
| MMMU-Pro (sans / avec Python) | 81,6 / 83,4 | 81,2 / 86,5 | 83,0 / 84,6 | 78,9 / 82,7 | 81,2 / 83,2 |
| CharXiv (RQ) | 84,8 / 91,3 | 88,9 / 93,5 | 84,6 / 89,1 | 80,5 / 89,9 | 84,1 / 89,0 |
| Math-Vision | 94,3 / 97,8 | 94,8 / 98,6 | 95,8 / 97,8 | 86,7 / 97,1 | 92,2 / 96,8 |
| ZeroBench-main (pass@5) | 23,0 / 41,0 | 23,0 / 46,0 | 17,0 / 35,0 | 17,0 / 34,0 | 22,0 / 41,0 |
L'effet des outils Python
L'amplification par outil est spectaculaire et cohérente avec le RL de raisonnement visuel en boucle :
| Banc | Sans Python | Avec Python | Gain |
|---|---|---|---|
| ZeroBench-main | 23,0 | 41,0 | +18,0 |
| Math-Vision | 94,3 | 97,8 | +3,5 |
| MMMU-Pro | 81,6 | 83,4 | +1,8 |
| CharXiv (RQ) | 84,8 | 91,3 | +6,5 |
C'est le bénéfice direct des environnements où le modèle recadre, zoome et calcule sur les images.
Premier sur trois bancs vision
OmniDocBench (91,1) — compréhension de documents, le domaine où l'entraînement OCR et le ViT depuis zéro devraient payer. Video-MME (90,0) et MMVU (82,1) — compréhension vidéo.
En retrait
WorldVQA : 51,0 contre 56,7 pour Fable 5, malgré une deuxième place très au-dessus de Sol (41,8). Le rapport note un « comportement de refus cohérent entre modèles » sur ce banc, contourné par ingénierie d'invite. CharXiv et BabyVision restent menés par Fable 5.
Synthèse¶
Le profil de Kimi K3, en trois lignes
Force : agents, recherche d'information, outillage, code long-horizon, documents, vidéo, développement web.
Parité : raisonnement scientifique structuré, usage d'ordinateur standard, mathématiques visuelles.
Faiblesse : raisonnement de niveau recherche (CritPt, HLE), travail de connaissance jugé par Elo, usage d'ordinateur difficile, recherche juridique.
Chapitre précédent : Comprendre les benchmarks · Chapitre suivant : Benchmarks internes