Benchmarks internes¶
Moonshot maintient une suite de bancs maison, conçus pour couvrir ce que les évaluations publiques ne couvrent pas.
Statut de ces chiffres
Ces bancs sont conçus, exécutés et notés par Moonshot, et leurs contenus ne sont pas publics. Ils ne sont pas vérifiables.
Leur intérêt n'est pas comparatif mais diagnostique : ils montrent où Moonshot elle-même situe les forces et les faiblesses de son modèle. Et le rapport reconnaît que cette suite « sépare les forces et faiblesses de K3 plus nettement que les benchmarks publics ».
Pourquoi une suite interne¶
Le rapport justifie ainsi : ces bancs « ciblent des domaines de capacité que les évaluations publiques ne couvrent pas adéquatement », et sont « rafraîchis et étendus fréquemment, afin de suivre au plus près les modes de défaillance évolutifs du modèle et de guider directement les itérations de données et d'entraînement ».
Ce que cela révèle du processus
Les bancs internes ne servent pas d'abord à communiquer, mais à piloter le développement. Ils sont conçus pour détecter les régressions et orienter les prochaines données d'entraînement.
Cela a une conséquence directe : le modèle est optimisé sur ces bancs. Ils mesurent donc en partie leur propre cible.
Expérience de codage¶
| Benchmark | Harnais | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|---|
| Kimi Code Bench 2.0 | Claude Code | 73,7 | 76,9 ᵃ | — | 71,7 | — | 64,2 |
| Kimi Code | 72,9 | — | — | — | 66,0 | — | |
| Codex | — | — | 64,8 ᵇ | — | 69,0 ᶜ | — | |
| Coding Experience | Claude Code | 59,9 | 59,8 | — | 58,0 | — | 53,3 |
| Kimi Code | 56,6 | — | — | — | — | — | |
| Codex | — | — | 59,3 | — | 56,8 | — |
ᵃ 13 replis et 1 refus sur 80 tâches · ᵇ 10 refus sur 80 · ᶜ 3 refus sur 80
Ce tableau illustre parfaitement l'effet du harnais
Kimi K3 obtient 73,7 avec Claude Code et 72,9 avec son propre harnais. GPT-5.5 obtient 66,0 avec Kimi Code et 69,0 avec Codex.
Comparer 73,7 (K3/Claude Code) à 64,8 (Sol/Codex) n'est pas une comparaison de modèles à conditions égales. Voir Comprendre les benchmarks.
Sur les refus et replis
Le rapport documente 13 replis et 1 refus pour Fable 5, 10 refus pour Sol, 3 pour GPT-5.5 — sur 80 tâches. Le banc contient des tâches liées à la cybersécurité et à la sûreté.
C'est une donnée importante : une partie de l'écart de score entre modèles ouverts et propriétaires sur ce type de banc reflète des politiques de refus, pas des différences de capacité.
Expérience d'agent général¶
| Benchmark | Harnais | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|---|
| 24/7 ClawBench 2.0 | OpenClaw | 48,3 | 47,4 ᵈ | 52,0 | 47,2 | 48,5 | 43,2 |
| MIRA Bench | MIRA | 64,1 | 72,9 | 62,2 | 59,8 | 54,6 | — |
| KAET | Kimi Code | 83,5 | — | 85,4 | 78,7 | 79,7 | 74,7 |
| CLIF Bench | Kimi Code | 52,4 | — | 50,6 | 48,8 | 52,3 | 39,2 |
| Agentic Vision Bench | Kimi Code | 78,3 | 81,1 | 82,9 | 82,8 | 76,9 | — |
| Swarm Bench | Kimi Agent | 76,3 | — | 73,2 | 72,6 | 61,8 | 58,5 |
| Online Experience | Kimi Agent | 77,9 | 74,2 ᵉ | 84,0 | 69,4 | 73,7 | 64,0 |
| Deep Research Bench | Kimi Agent | 90,0 | — | 85,3 | 87,2 | 81,9 | 84,0 |
| Finance Bench | — | 62,6 | — | 62,7 | 60,7 | 58,4 | 55,4 |
| KWV Bench | — | 64,7 | 63,6 | 66,9 | 61,7 | 65,8 | — |
| DECK Bench | — | 73,5 | 73,0 | 74,7 | 66,9 | 68,2 | 68,6 |
| Agent Behavior Bench | Kimi Work | 65,0 | 75,5 ᶠ | 76,4 | 65,7 | 70,1 | — |
ᵈ inclut 2 tâches refusées par Fable 5 · ᵉ inclut 14 tâches refusées par Fable 5 · ᶠ 6 refus sur 95 tâches
Ce que ces bancs mesurent¶
| Banc | Objet |
|---|---|
| 24/7 ClawBench 2.0 | Travail d'assistant toujours actif : tâches sur plusieurs jours, événements concurrents, interruptions routinières |
| MIRA Bench | Collaboration d'entreprise multi-rôles, multi-systèmes ; capacité à organiser ou déléguer à des sous-agents |
| KAET | Exécution autonome long-horizon sur des requêtes utilisateur réelles et opérations de systèmes d'entreprise |
| CLIF Bench | Apprentissage en contexte et suivi d'instructions entrelaçant plusieurs compétences complexes |
| Agentic Vision Bench | L'agent remarque-t-il et utilise-t-il correctement les faits visuels clés ? |
| Swarm Bench | Orchestration d'essaims d'agents sur des tâches à décomposition parallèle |
| Online Experience | Distribution réelle de l'usage en ligne, par types de fichiers livrables |
| Deep Research Bench | Requêtes de recherche approfondie curées par des experts, grilles alignées experts |
| Finance Bench | Flux financiers complets, des sources aux livrables révisables |
| KWV Bench | Capacités visuelles atomiques extraites de scénarios de travail de connaissance |
| DECK Bench | Production de présentations de qualité |
| Agent Behavior Bench | Qualité du processus, pas seulement du résultat : usage d'outils, efficacité, discipline |
Expérience conversationnelle¶
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| Faithfulness ᵍ | 85,5 | — | 84,8 | 83,6 | 86,5 | 74,8 |
| Chat All-in-One Bench | 85,2 | 88,0 | 79,0 | 83,8 | 71,8 | — |
ᵍ Métrique = 1 − taux d'hallucination ; plus haut est meilleur
Sur la fidélité
Un taux d'hallucination de 14,5 % (soit 85,5 % de fidélité) mesuré par un vérificateur de faits, sur une distribution de questions non publiée. À comparer à 13,5 % pour GPT-5.5 et 25,2 % pour GLM-5.2.
C'est un des rares chiffres où GPT-5.5 devance tout le monde, y compris GPT-5.6 Sol.
Le banc Kimi Webdev¶
Un banc à jugement expert en aveugle, opposant Kimi K3 à Claude Opus 4.8, tous deux sous harnais Claude Code. Les experts notent chaque sortie sur la qualité du code, la complétude fonctionnelle, la fidélité visuelle et l'expérience d'interaction, sans savoir quel modèle a produit quoi.
| Domaine | Victoire | Égalité | Défaite | Victoire − défaite |
|---|---|---|---|---|
| Jeux | 55,6 % | 3,7 % | 40,7 % | +14,9 % |
| 3D / WebGL / Shader | 72,7 % | 13,7 % | 13,6 % | +59,1 % |
| Site web / clone d'UI | 52,6 % | 21,1 % | 26,3 % | +26,3 % |
| Global | 58,6 % | 13,8 % | 27,6 % | +31,0 % |
Le résultat le plus significatif du rapport
+59,1 points d'écart sur les tâches 3D / WebGL / Shader.
C'est un écart considérable, obtenu en jugement aveugle par des experts humains, sur une comparaison à harnais identique. C'est méthodologiquement l'un des chiffres les plus solides de tout le rapport — même s'il reste interne.
Il est cohérent avec deux choix documentés : le corpus de données multimodales programmatiques (code couplé à son rendu) et le RL sur les tâches de développement web.
Et il est corroboré par un tiers : Kimi K3 est premier du WebDev Arena.
Ce que Moonshot dit de ses propres résultats¶
Les forces identifiées
- Agentivité d'orchestration et de recherche : Swarm Bench (76,3) et Deep Research Bench (90,0), « avec des marges nettes ».
- Codage : second seulement derrière Fable 5 sur KCB 2.0, meilleur score sur Coding Experience — ce qui suggère que « son comportement pratique comme agent de code — qualité de communication, adéquation comportementale, stabilité du suivi d'instructions — devance ses scores de tâche bruts ».
- Travail de connaissance professionnel : « nettement amélioré » ; Finance Bench essentiellement à égalité avec GPT-5.6 Sol.
Les faiblesses reconnues
Kimi K3 trails the leaders mainly on Agent Behavior Bench, MIRA Bench, 24/7 ClawBench 2.0, Agentic Vision Bench, and KWV Bench.
Ces cinq bancs dessinent un motif cohérent :
| Banc | Ce qui manque |
|---|---|
| Agent Behavior Bench (65,0 vs 76,4) | Qualité du processus — discipline, efficacité, comportement |
| MIRA Bench (64,1 vs 72,9) | Généralisation à un harnais hors distribution |
| 24/7 ClawBench (48,3 vs 52,0) | Assistant persistant, événements concurrents |
| Agentic Vision Bench (78,3 vs 82,9) | Remarquer les faits visuels pendant l'exécution |
| KWV Bench (64,7 vs 66,9) | Capacités visuelles atomiques du travail de connaissance |
L'écart le plus révélateur
Agent Behavior Bench : 65,0 contre 76,4 pour GPT-5.6 Sol — 11,4 points.
Ce banc « étend l'évaluation d'agent de la justesse du résultat à la qualité du processus, notant le comportement d'usage d'outils, l'efficacité et la discipline en plus de la complétion ».
Autrement dit : Kimi K3 arrive au bon résultat, mais par un chemin moins propre. C'est cohérent avec la limitation reconnue par ailleurs — une « proactivité excessive dans les situations ambiguës » — et avec l'écart d'expérience utilisateur que Moonshot admet face à Fable 5 et Sol.
Chapitre précédent : Résultats publics · Chapitre suivant : Évaluations tierces