Évaluations¶
Cette partie présente les résultats de Kimi K3 en séparant strictement ce qui est mesuré par Moonshot de ce qui est mesuré par des tiers.
Principe méthodologique de cette partie
Les benchmarks publiés dans un rapport technique de constructeur ne sont pas des évaluations indépendantes. Ils sont produits par l'équipe qui a entraîné le modèle, qui choisit les bancs, les harnais, les configurations et les concurrents.
Cela ne les rend pas faux. Cela les rend non neutres. Le chapitre Comprendre les benchmarks explique précisément où se logent les biais.
Ordre de lecture¶
| # | Chapitre | Contenu |
|---|---|---|
| 01 | Comprendre les benchmarks | À lire en premier. Ce qu'un score mesure vraiment |
| 02 | Résultats publics | Le grand tableau, benchmark par benchmark |
| 03 | Benchmarks internes | La suite maison de Moonshot |
| 04 | Évaluations tierces | Artificial Analysis, Vals AI, Arena, UK AISI |
| 05 | Coût et efficacité | Score contre prix par tâche |
| 06 | Cybersécurité | Découverte de vulnérabilités, développement d'exploits |
| 07 | Études de cas | Noyaux GPU, compilateur, puce, recherche, vidéo |
Le résumé en une image¶
Claude Fable 5 ████████████████████ 59,9
Artificial GPT-5.6 Sol ███████████████████ 58,9
Analysis v4.1 KIMI K3 ██████████████████ 57,1 ← #4/580
Claude Opus 4.8 █████████████████ 55,7
GPT-5.5 ████████████████ 55,0
GLM-5.2 ██████████████ 51,1
WebDev Arena KIMI K3 ████████████████████ 1 678 ← #1/99
Claude Fable 5 ███████████████████ 1 634
GPT-5.6 Sol ███████████████████ 1 630
Vals Index Claude Fable 5 ████████████████████ 75,1 %
KIMI K3 ███████████████████ 74,7 % ← #2/39
GPT-5.6 Sol ██████████████████ 73,1 %
Le positionnement réel, en une phrase
Kimi K3 est quatrième au classement d'intelligence générale d'Artificial Analysis, deuxième sur les tâches professionnelles de Vals AI, et premier au monde sur le développement web — tout en étant le seul de ce peloton dont les poids sont téléchargeables.
Les concurrents évalués¶
| Modèle | Type | Réglage utilisé |
|---|---|---|
| Kimi K3 | Poids ouverts | effort max, température 1,0 |
| Claude Fable 5 | Propriétaire | max, avec comportements de repli |
| GPT-5.6 Sol | Propriétaire | max, avec cybergardes éventuelles |
| Claude Opus 4.8 | Propriétaire | max |
| GPT-5.5 | Propriétaire | xhigh |
| GLM-5.2 | Poids ouverts | max |
Une note d'honnêteté du rapport
Le rapport signale explicitement que « les résultats de Claude Fable 5 incluent des comportements de repli » (fallback) et que « les résultats de GPT-5.6 Sol incluent d'éventuelles cybergardes ».
Sur SWE-Marathon, il précise même que Claude Fable 5 atteint des replis sur 35 % des tâches. Ce sont des informations qui désavantagent le concurrent et qu'un rapport moins scrupuleux aurait pu omettre — mais elles servent aussi à relativiser des scores où K3 est devancé.
Les quatre axes de capacité¶
| Axe | Bancs représentatifs |
|---|---|
| Raisonnement et connaissance | GPQA Diamond, CritPt, AA-LCR, HLE-Full |
| Codage | DeepSWE, ProgramBench, Terminal-Bench 2.1, FrontierSWE, SWE-Marathon, PostTrainBench, MLS-Bench-Lite, SciCode |
| Agentique | BrowseComp, DeepSearchQA, GDPval, Toolathlon, MCPMark, MCP-Atlas, OSWorld, τ³-Banking, Harvey Lab, CorpFin… |
| Vision | WorldVQA, OmniDocBench, PerceptionBench, Video-MME, MMVU, MMMU-Pro, CharXiv, Math-Vision, ZeroBench |
Partie précédente : Infrastructure · Partie suivante : Reproduire Kimi K3