Aller au contenu

Coût et efficacité

Un score sans son prix ne dit rien. Le rapport consacre une section à l'arbitrage score/coût — c'est l'argument commercial central de Kimi K3.

Le protocole

Quatre suites couvrant le codage et l'agentique, avec le score porté contre le coût par tâche :

Suite Source du coût
Kimi Code Bench 2.0 Mesuré en interne — K3 via Kimi Code, les autres via Claude Code
BrowseComp K3 mesuré sur leurs propres exécutions ; Claude et GPT cités depuis des graphiques publiés
GDPval-AA v2 Tarification API à l'usage d'Artificial Analysis, au 23 juillet 2026
AA-Briefcase Idem

Un mélange de sources

Les coûts proviennent de trois origines différentes : mesures internes, citations de graphiques tiers, et grilles tarifaires publiées. Ce n'est pas une méthodologie homogène, et le rapport le déclare.

Notamment, comparer un coût mesuré pour K3 à un coût cité pour les concurrents introduit un biais potentiel : les conditions de mesure ne sont pas identiques.

Les résultats

Kimi Code Bench 2.0

Constat Chiffre
À effort max 4,0 points derrière Claude Fable 5, pour 38 % de son coût
À effort high Égale déjà le score d'effort max de Claude Opus 4.8, pour ~1/3 du coût

La lecture

Le second point est le plus intéressant : il montre que l'effort est un curseur de coût utilisable. Descendre de max à high ne fait pas seulement économiser — cela place le modèle sur un point du plan score/coût que le concurrent ne peut pas atteindre.

BrowseComp

Modèle Score Coût par tâche
Kimi K3 91,2 % 2,03 $
GPT-5.6 Sol 90,4 % ~4 $ (le double)
Claude (effort max) — un ordre de grandeur de plus

Le meilleur résultat coût/score du rapport

Kimi K3 obtient le meilleur score de la suite et le coût le plus bas des trois. C'est une domination sur les deux axes simultanément, ce qui est rare.

GDPval-AA v2

Constat Chiffre
Face à GPT-5.6 Sol À moins de 50 Elo, pour 13 % de coût en moins
Face à Claude Fable 5 2,6× moins cher

Rappel : K3 est troisième sur ce banc en score absolu (1 686 contre 1 747 et 1 736). L'argument est donc bien un argument de rapport qualité/prix, pas de supériorité.

AA-Briefcase

Deuxième meilleur score, derrière Claude Fable 5, pour environ la moitié de son coût.

La conclusion du rapport

Overall, Kimi K3 sits on or near the cost-efficiency frontier across all four suites, delivering near-top scores at a fraction of the cost of Claude Fable 5 in particular.

Ce que « frontière d'efficacité coût » signifie

Dans un plan score × coût, la frontière de Pareto est l'ensemble des points qu'on ne peut pas améliorer sur un axe sans dégrader l'autre.

Être « sur ou près » de cette frontière signifie : aucun autre modèle ne fait à la fois mieux et moins cher. C'est une affirmation plus faible que « meilleur », mais commercialement plus pertinente.

La contradiction avec Artificial Analysis

Deux lectures opposées du même modèle

Artificial Analysis relève chez Kimi K3 une consommation élevée de jetons de sortie, une vitesse de génération inférieure à la médiane, et une tarification premium relativement aux autres modèles ouverts.

Le rapport de Moonshot conclut à une excellente efficacité coût.

Les deux peuvent être vrais simultanément, et voici pourquoi :

Point de comparaison Verdict
K3 face aux modèles propriétaires de frontière Bon marché (moitié à un tiers du prix)
K3 face aux autres modèles ouverts Cher (premium, et il consomme plus de jetons)
K3 en latence Lent (beaucoup de jetons de raisonnement, génération sous la médiane)

Moonshot compare au premier groupe. Artificial Analysis situe dans l'ensemble du marché.

La formulation honnête

Kimi K3 est le modèle le moins cher de son niveau de capacité, et le plus cher et le plus lent parmi les modèles ouverts. Ces deux affirmations ne se contredisent pas : elles décrivent sa position réelle.

Le coût de l'auto-hébergement

L'analyse coût/score porte sur l'usage par API. L'auto-hébergement change complètement l'équation.

Poste Ordre de grandeur
Téléchargement des poids 1,56 To
GPU nécessaires Cluster multi-nœuds, ~20+ GPU de classe H100/H200
Coût d'infrastructure Des dizaines de milliers de dollars par mois
Coût marginal par jeton Quasi nul, une fois le cluster amorti

Quand l'auto-hébergement devient rentable

Le calcul est simple : à 3 $/M jetons en entrée et 15 $/M en sortie, il faut consommer un volume considérable pour amortir un cluster. L'auto-hébergement se justifie surtout pour deux raisons non économiques :

  • souveraineté des données — aucune requête ne quitte l'infrastructure ;
  • garantie de disponibilité — pas de dépendance à un fournisseur.

C'est le vrai argument des poids ouverts, et la licence l'autorise explicitement pour l'usage interne, sans condition de revenu. Voir Licence.

Vérification de compréhension

Pourquoi K3 consomme-t-il beaucoup de jetons de sortie ?

Parce qu'il fonctionne toujours en mode réflexion, et que toutes les évaluations publiées sont à effort max. Le raisonnement est facturé comme jetons de sortie, au tarif le plus élevé (15 $/M). C'est aussi pourquoi les modes high et low ont une valeur économique réelle.

Le tarif de cache à 0,30 $/M change-t-il beaucoup la donne ?

Énormément, en usage agentique. Une session qui relit 400 K jetons de préfixe à chaque tour coûterait 1,20 $ par tour sans cache, contre 0,12 $ avec. Sur une session de 100 tours, l'écart est de 108 $. C'est ce qui justifie tout le travail décrit en Cache de préfixe hybride.


Chapitre précédent : Évaluations tierces · Chapitre suivant : Cybersécurité