Aller au contenu

Évaluations tierces

Les chiffres de cette page sont les plus fiables du dossier : ils sont produits par des organisations indépendantes de Moonshot, avec leurs propres protocoles.

État au 23 juillet 2026, tel que rapporté dans le tableau 4 du rapport.

Artificial Analysis

Organisation indépendante d'évaluation de modèles, qui maintient un indice composite.

Score
Claude Fable 5 59,9
GPT-5.6 Sol 58,9
Kimi K3 57,1
Claude Opus 4.8 55,7
GPT-5.5 55,0
GLM-5.2 51,1

Le classement

Intelligence Index v4.1 : #4 sur 580 modèles — et #3 si l'on compte les variantes d'effort de GPT-5.6 Sol comme une seule entrée.

Kimi K3 devance tous les autres modèles évalués, propriétaires compris.

Ce qu'Artificial Analysis mesure aussi

Selon des analyses secondaires, Artificial Analysis relève également chez Kimi K3 :

  • une consommation élevée de jetons de sortie ;
  • une vitesse de génération inférieure à la médiane ;
  • une tarification premium relativement à d'autres modèles ouverts.

Ces trois points nuancent le tableau : l'intelligence est proche du sommet, mais elle se paie en jetons et en latence. À croiser avec Coût et efficacité, qui présente l'analyse coût/score de Moonshot — plus favorable.

Vals AI

Suite de bancs sectoriels pondérée par le PIB, orientée usages professionnels réels (finance, juridique, santé…).

Vals Index
Claude Fable 5 75,1 %
Kimi K3 74,7 %
GPT-5.6 Sol 73,1 %
Claude Opus 4.8 70,4 %
GPT-5.5 68,0 %
GLM-5.2 65,0 %

Le classement

#2 sur 39 modèles, à 0,4 point de Claude Fable 5, et devant GPT-5.6 Sol.

C'est l'un des résultats les plus significatifs du dossier : sur des tâches professionnelles évaluées par un tiers, Kimi K3 est essentiellement à égalité avec le meilleur modèle propriétaire du monde.

Les arènes de préférence humaine (LMArena)

Classements par vote humain en aveugle.

Arène Kimi K3 Rang Meilleur concurrent
WebDev Arena 1 678 Elo #1 / 99 Claude Fable 5 : 1 634
Text Arena 1 486 Elo #8 / 200 Claude Fable 5 : 1 507
Agent Arena 9,1 #4 / 37 Claude Fable 5 : 12,7

Premier modèle ouvert à dominer le WebDev Arena

Le rapport souligne ce point : le premier modèle ouvert à prendre la tête de ce classement, avec 44 Elo d'avance sur Claude Fable 5.

C'est une validation indépendante, par jugement humain, du résultat interne de +31,0 points sur le Kimi Webdev Bench — et de l'écart de +59,1 sur les tâches 3D/WebGL.

Quand une mesure interne et une mesure tierce indépendante convergent, la confiance monte nettement.

Text Arena et Agent Arena, plus modestes

  • Text Arena : #8 sur 200, à 21 Elo du premier. Honorable, mais la conversation généraliste n'est manifestement pas le point fort de K3.
  • Agent Arena : #4 sur 37, à 3,6 points de Fable 5. Le rapport précise que cette arène n'a ouvert au vote que vers le 19 juillet — les scores sont donc peu stabilisés.

Sur la dérive des Elo

Le rapport le note : Elo-style scores drift as additional matches accumulate. Ces chiffres sont un instantané au 23 juillet 2026, pas une vérité stable.

L'évaluation conjointe UK AISI / NIST CAISI

C'est l'évaluation tierce la plus institutionnelle : une évaluation conjointe du UK AI Security Institute et du Center for AI Standards and Innovation du NIST, portant sur les capacités cyber de Kimi K3.

Ses conclusions, telles que rapportées

  • Kimi K3 devance GLM-5.2 sur le développement d'exploits : 32 % contre 24 % sur ExploitBench.
  • Sur un réseau d'entreprise simulé en 32 étapes, qui prend à un expert humain environ 20 heures : Kimi K3 franchit 17 étapes, GLM-5.2 en franchit 11.
  • Mais Kimi K3 reste en retrait des modèles de frontière capables en cyber sur la complétion d'exploits de bout en bout : exécution de code arbitraire obtenue sur 0 tâche sur 41.

Pourquoi cette évaluation compte particulièrement

Elle est cohérente avec l'auto-évaluation de Moonshot, qui concluait à une capacité réelle mais à « un écart clair au niveau expert humain ».

Quand une auto-évaluation et une évaluation gouvernementale indépendante convergent sur un domaine sensible, c'est un indicateur de sérieux du processus d'évaluation interne.

Détail complet en Cybersécurité.

Les critiques indépendantes

Plusieurs analyses publiées après la sortie apportent des nuances qui n'apparaissent nulle part dans le rapport.

Sur la reproductibilité des scores de codage

Une analyse de NxCode relève que les résultats de codage mélangent au moins trois configurations de harnais (Kimi Code, Claude Code, mini-SWE-agent), et conclut que le score de 88,3 sur Terminal-Bench 2.1 « nécessite une trace publique et une reproduction sous harnais commun avant de devenir un fait comparatif propre ».

Conclusion générale de cette analyse : les chiffres tiers soutiennent globalement les chiffres internes, mais K3 ne dispose pas encore d'assez de preuves reproduites indépendamment sous harnais commun pour justifier une revendication universelle de « meilleur modèle de code ».

Sur l'écart entre laboratoire et production

Une analyse de Kili Technology documente un écart de 37 % entre scores de benchmark et performance réelle en déploiement, à l'échelle de l'industrie. Sur les scénarios dynamiques à invariants cachés, elle mesure un taux d'échec de 36 % pour K3 contre 8 % pour Claude Opus 4.8.

Prudence sur ce chiffre

Cette mesure provient d'un fournisseur de services de données d'entraînement, dont la méthodologie n'est pas détaillée dans les sources consultées. Elle n'est pas reproductible en l'état et doit être traitée comme une indication qualitative, non comme un résultat établi.

Elle est néanmoins cohérente avec le point faible reconnu par Moonshot elle-même sur l'Agent Behavior Bench (65,0 contre 76,4) — la qualité du processus plutôt que du résultat.

Synthèse

Ce que les tiers confirment

Affirmation Vérifiée par
Kimi K3 est proche de la frontière Artificial Analysis (#4/580)
Il est compétitif sur le travail professionnel Vals AI (#2/39)
Il domine le développement web LMArena WebDev (#1/99)
Il devance nettement les autres modèles ouverts Les trois sources
Ses capacités cyber sont réelles mais sous le niveau expert UK AISI / CAISI

Ce que les tiers ne confirment pas

Affirmation Statut
« 2,5× d'efficacité d'échelle » Aucune vérification possible
Les scores de codage sous harnais mixtes Contestés méthodologiquement
La performance en déploiement réel Signaux contradictoires
La supériorité sur les tâches long-horizon dynamiques Contestée par une analyse tierce

Chapitre précédent : Benchmarks internes · Chapitre suivant : Coût et efficacité

Sources de cette page : voir Sources.