Aller au contenu

Benchmarks internes

Moonshot maintient une suite de bancs maison, conçus pour couvrir ce que les évaluations publiques ne couvrent pas.

Statut de ces chiffres

Ces bancs sont conçus, exécutés et notés par Moonshot, et leurs contenus ne sont pas publics. Ils ne sont pas vérifiables.

Leur intérêt n'est pas comparatif mais diagnostique : ils montrent où Moonshot elle-même situe les forces et les faiblesses de son modèle. Et le rapport reconnaît que cette suite « sépare les forces et faiblesses de K3 plus nettement que les benchmarks publics ».

Pourquoi une suite interne

Le rapport justifie ainsi : ces bancs « ciblent des domaines de capacité que les évaluations publiques ne couvrent pas adéquatement », et sont « rafraîchis et étendus fréquemment, afin de suivre au plus près les modes de défaillance évolutifs du modèle et de guider directement les itérations de données et d'entraînement ».

Ce que cela révèle du processus

Les bancs internes ne servent pas d'abord à communiquer, mais à piloter le développement. Ils sont conçus pour détecter les régressions et orienter les prochaines données d'entraînement.

Cela a une conséquence directe : le modèle est optimisé sur ces bancs. Ils mesurent donc en partie leur propre cible.

Expérience de codage

Benchmark Harnais Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2
Kimi Code Bench 2.0 Claude Code 73,7 76,9 ᵃ — 71,7 — 64,2
Kimi Code 72,9 — — — 66,0 —
Codex — — 64,8 ᵇ — 69,0 ᶜ —
Coding Experience Claude Code 59,9 59,8 — 58,0 — 53,3
Kimi Code 56,6 — — — — —
Codex — — 59,3 — 56,8 —

ᵃ 13 replis et 1 refus sur 80 tâches · ᵇ 10 refus sur 80 · ᶜ 3 refus sur 80

Ce tableau illustre parfaitement l'effet du harnais

Kimi K3 obtient 73,7 avec Claude Code et 72,9 avec son propre harnais. GPT-5.5 obtient 66,0 avec Kimi Code et 69,0 avec Codex.

Comparer 73,7 (K3/Claude Code) à 64,8 (Sol/Codex) n'est pas une comparaison de modèles à conditions égales. Voir Comprendre les benchmarks.

Sur les refus et replis

Le rapport documente 13 replis et 1 refus pour Fable 5, 10 refus pour Sol, 3 pour GPT-5.5 — sur 80 tâches. Le banc contient des tâches liées à la cybersécurité et à la sûreté.

C'est une donnée importante : une partie de l'écart de score entre modèles ouverts et propriétaires sur ce type de banc reflète des politiques de refus, pas des différences de capacité.

Expérience d'agent général

Benchmark Harnais Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2
24/7 ClawBench 2.0 OpenClaw 48,3 47,4 ᵈ 52,0 47,2 48,5 43,2
MIRA Bench MIRA 64,1 72,9 62,2 59,8 54,6 —
KAET Kimi Code 83,5 — 85,4 78,7 79,7 74,7
CLIF Bench Kimi Code 52,4 — 50,6 48,8 52,3 39,2
Agentic Vision Bench Kimi Code 78,3 81,1 82,9 82,8 76,9 —
Swarm Bench Kimi Agent 76,3 — 73,2 72,6 61,8 58,5
Online Experience Kimi Agent 77,9 74,2 ᵉ 84,0 69,4 73,7 64,0
Deep Research Bench Kimi Agent 90,0 — 85,3 87,2 81,9 84,0
Finance Bench — 62,6 — 62,7 60,7 58,4 55,4
KWV Bench — 64,7 63,6 66,9 61,7 65,8 —
DECK Bench — 73,5 73,0 74,7 66,9 68,2 68,6
Agent Behavior Bench Kimi Work 65,0 75,5 ᶠ 76,4 65,7 70,1 —

ᵈ inclut 2 tâches refusées par Fable 5 · ᵉ inclut 14 tâches refusées par Fable 5 · ᶠ 6 refus sur 95 tâches

Ce que ces bancs mesurent

Banc Objet
24/7 ClawBench 2.0 Travail d'assistant toujours actif : tâches sur plusieurs jours, événements concurrents, interruptions routinières
MIRA Bench Collaboration d'entreprise multi-rôles, multi-systèmes ; capacité à organiser ou déléguer à des sous-agents
KAET Exécution autonome long-horizon sur des requêtes utilisateur réelles et opérations de systèmes d'entreprise
CLIF Bench Apprentissage en contexte et suivi d'instructions entrelaçant plusieurs compétences complexes
Agentic Vision Bench L'agent remarque-t-il et utilise-t-il correctement les faits visuels clés ?
Swarm Bench Orchestration d'essaims d'agents sur des tâches à décomposition parallèle
Online Experience Distribution réelle de l'usage en ligne, par types de fichiers livrables
Deep Research Bench Requêtes de recherche approfondie curées par des experts, grilles alignées experts
Finance Bench Flux financiers complets, des sources aux livrables révisables
KWV Bench Capacités visuelles atomiques extraites de scénarios de travail de connaissance
DECK Bench Production de présentations de qualité
Agent Behavior Bench Qualité du processus, pas seulement du résultat : usage d'outils, efficacité, discipline

Expérience conversationnelle

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol Claude Opus 4.8 GPT-5.5 GLM-5.2
Faithfulness ᵍ 85,5 — 84,8 83,6 86,5 74,8
Chat All-in-One Bench 85,2 88,0 79,0 83,8 71,8 —

ᵍ Métrique = 1 − taux d'hallucination ; plus haut est meilleur

Sur la fidélité

Un taux d'hallucination de 14,5 % (soit 85,5 % de fidélité) mesuré par un vérificateur de faits, sur une distribution de questions non publiée. À comparer à 13,5 % pour GPT-5.5 et 25,2 % pour GLM-5.2.

C'est un des rares chiffres où GPT-5.5 devance tout le monde, y compris GPT-5.6 Sol.

Le banc Kimi Webdev

Un banc à jugement expert en aveugle, opposant Kimi K3 à Claude Opus 4.8, tous deux sous harnais Claude Code. Les experts notent chaque sortie sur la qualité du code, la complétude fonctionnelle, la fidélité visuelle et l'expérience d'interaction, sans savoir quel modèle a produit quoi.

Domaine Victoire Égalité Défaite Victoire − défaite
Jeux 55,6 % 3,7 % 40,7 % +14,9 %
3D / WebGL / Shader 72,7 % 13,7 % 13,6 % +59,1 %
Site web / clone d'UI 52,6 % 21,1 % 26,3 % +26,3 %
Global 58,6 % 13,8 % 27,6 % +31,0 %

Le résultat le plus significatif du rapport

+59,1 points d'écart sur les tâches 3D / WebGL / Shader.

C'est un écart considérable, obtenu en jugement aveugle par des experts humains, sur une comparaison à harnais identique. C'est méthodologiquement l'un des chiffres les plus solides de tout le rapport — même s'il reste interne.

Il est cohérent avec deux choix documentés : le corpus de données multimodales programmatiques (code couplé à son rendu) et le RL sur les tâches de développement web.

Et il est corroboré par un tiers : Kimi K3 est premier du WebDev Arena.

Ce que Moonshot dit de ses propres résultats

Les forces identifiées

  • Agentivité d'orchestration et de recherche : Swarm Bench (76,3) et Deep Research Bench (90,0), « avec des marges nettes ».
  • Codage : second seulement derrière Fable 5 sur KCB 2.0, meilleur score sur Coding Experience — ce qui suggère que « son comportement pratique comme agent de code — qualité de communication, adéquation comportementale, stabilité du suivi d'instructions — devance ses scores de tâche bruts ».
  • Travail de connaissance professionnel : « nettement amélioré » ; Finance Bench essentiellement à égalité avec GPT-5.6 Sol.

Les faiblesses reconnues

Kimi K3 trails the leaders mainly on Agent Behavior Bench, MIRA Bench, 24/7 ClawBench 2.0, Agentic Vision Bench, and KWV Bench.

Ces cinq bancs dessinent un motif cohérent :

Banc Ce qui manque
Agent Behavior Bench (65,0 vs 76,4) Qualité du processus — discipline, efficacité, comportement
MIRA Bench (64,1 vs 72,9) Généralisation à un harnais hors distribution
24/7 ClawBench (48,3 vs 52,0) Assistant persistant, événements concurrents
Agentic Vision Bench (78,3 vs 82,9) Remarquer les faits visuels pendant l'exécution
KWV Bench (64,7 vs 66,9) Capacités visuelles atomiques du travail de connaissance

L'écart le plus révélateur

Agent Behavior Bench : 65,0 contre 76,4 pour GPT-5.6 Sol — 11,4 points.

Ce banc « étend l'évaluation d'agent de la justesse du résultat à la qualité du processus, notant le comportement d'usage d'outils, l'efficacité et la discipline en plus de la complétion ».

Autrement dit : Kimi K3 arrive au bon résultat, mais par un chemin moins propre. C'est cohérent avec la limitation reconnue par ailleurs — une « proactivité excessive dans les situations ambiguës » — et avec l'écart d'expérience utilisateur que Moonshot admet face à Fable 5 et Sol.


Chapitre précédent : Résultats publics · Chapitre suivant : Évaluations tierces