Aller au contenu

Évaluations

Cette partie présente les résultats de Kimi K3 en séparant strictement ce qui est mesuré par Moonshot de ce qui est mesuré par des tiers.

Principe méthodologique de cette partie

Les benchmarks publiés dans un rapport technique de constructeur ne sont pas des évaluations indépendantes. Ils sont produits par l'équipe qui a entraîné le modèle, qui choisit les bancs, les harnais, les configurations et les concurrents.

Cela ne les rend pas faux. Cela les rend non neutres. Le chapitre Comprendre les benchmarks explique précisément où se logent les biais.

Ordre de lecture

# Chapitre Contenu
01 Comprendre les benchmarks À lire en premier. Ce qu'un score mesure vraiment
02 Résultats publics Le grand tableau, benchmark par benchmark
03 Benchmarks internes La suite maison de Moonshot
04 Évaluations tierces Artificial Analysis, Vals AI, Arena, UK AISI
05 Coût et efficacité Score contre prix par tâche
06 Cybersécurité Découverte de vulnérabilités, développement d'exploits
07 Études de cas Noyaux GPU, compilateur, puce, recherche, vidéo

Le résumé en une image

                     Claude Fable 5   ████████████████████  59,9
   Artificial        GPT-5.6 Sol      ███████████████████   58,9
   Analysis v4.1     KIMI K3          ██████████████████    57,1   ← #4/580
                     Claude Opus 4.8  █████████████████     55,7
                     GPT-5.5          ████████████████      55,0
                     GLM-5.2          ██████████████        51,1

   WebDev Arena      KIMI K3          ████████████████████  1 678  ← #1/99
                     Claude Fable 5   ███████████████████   1 634
                     GPT-5.6 Sol      ███████████████████   1 630

   Vals Index        Claude Fable 5   ████████████████████  75,1 %
                     KIMI K3          ███████████████████   74,7 %  ← #2/39
                     GPT-5.6 Sol      ██████████████████    73,1 %

Le positionnement réel, en une phrase

Kimi K3 est quatrième au classement d'intelligence générale d'Artificial Analysis, deuxième sur les tâches professionnelles de Vals AI, et premier au monde sur le développement web — tout en étant le seul de ce peloton dont les poids sont téléchargeables.

Les concurrents évalués

Modèle Type Réglage utilisé
Kimi K3 Poids ouverts effort max, température 1,0
Claude Fable 5 Propriétaire max, avec comportements de repli
GPT-5.6 Sol Propriétaire max, avec cybergardes éventuelles
Claude Opus 4.8 Propriétaire max
GPT-5.5 Propriétaire xhigh
GLM-5.2 Poids ouverts max

Une note d'honnêteté du rapport

Le rapport signale explicitement que « les résultats de Claude Fable 5 incluent des comportements de repli » (fallback) et que « les résultats de GPT-5.6 Sol incluent d'éventuelles cybergardes ».

Sur SWE-Marathon, il précise même que Claude Fable 5 atteint des replis sur 35 % des tâches. Ce sont des informations qui désavantagent le concurrent et qu'un rapport moins scrupuleux aurait pu omettre — mais elles servent aussi à relativiser des scores où K3 est devancé.

Les quatre axes de capacité

Axe Bancs représentatifs
Raisonnement et connaissance GPQA Diamond, CritPt, AA-LCR, HLE-Full
Codage DeepSWE, ProgramBench, Terminal-Bench 2.1, FrontierSWE, SWE-Marathon, PostTrainBench, MLS-Bench-Lite, SciCode
Agentique BrowseComp, DeepSearchQA, GDPval, Toolathlon, MCPMark, MCP-Atlas, OSWorld, τ³-Banking, Harvey Lab, CorpFin…
Vision WorldVQA, OmniDocBench, PerceptionBench, Video-MME, MMVU, MMMU-Pro, CharXiv, Math-Vision, ZeroBench

Partie précédente : Infrastructure · Partie suivante : Reproduire Kimi K3