Coût et efficacité¶
Un score sans son prix ne dit rien. Le rapport consacre une section à l'arbitrage score/coût — c'est l'argument commercial central de Kimi K3.
Le protocole¶
Quatre suites couvrant le codage et l'agentique, avec le score porté contre le coût par tâche :
| Suite | Source du coût |
|---|---|
| Kimi Code Bench 2.0 | Mesuré en interne — K3 via Kimi Code, les autres via Claude Code |
| BrowseComp | K3 mesuré sur leurs propres exécutions ; Claude et GPT cités depuis des graphiques publiés |
| GDPval-AA v2 | Tarification API à l'usage d'Artificial Analysis, au 23 juillet 2026 |
| AA-Briefcase | Idem |
Un mélange de sources
Les coûts proviennent de trois origines différentes : mesures internes, citations de graphiques tiers, et grilles tarifaires publiées. Ce n'est pas une méthodologie homogène, et le rapport le déclare.
Notamment, comparer un coût mesuré pour K3 à un coût cité pour les concurrents introduit un biais potentiel : les conditions de mesure ne sont pas identiques.
Les résultats¶
Kimi Code Bench 2.0¶
| Constat | Chiffre |
|---|---|
À effort max |
4,0 points derrière Claude Fable 5, pour 38 % de son coût |
À effort high |
Égale déjà le score d'effort max de Claude Opus 4.8, pour ~1/3 du coût |
La lecture
Le second point est le plus intéressant : il montre que l'effort est un
curseur de coût utilisable. Descendre de max à high ne fait pas
seulement économiser — cela place le modèle sur un point du plan
score/coût que le concurrent ne peut pas atteindre.
BrowseComp¶
| Modèle | Score | Coût par tâche |
|---|---|---|
| Kimi K3 | 91,2 % | 2,03 $ |
| GPT-5.6 Sol | 90,4 % | ~4 $ (le double) |
| Claude (effort max) | — | un ordre de grandeur de plus |
Le meilleur résultat coût/score du rapport
Kimi K3 obtient le meilleur score de la suite et le coût le plus bas des trois. C'est une domination sur les deux axes simultanément, ce qui est rare.
GDPval-AA v2¶
| Constat | Chiffre |
|---|---|
| Face à GPT-5.6 Sol | À moins de 50 Elo, pour 13 % de coût en moins |
| Face à Claude Fable 5 | 2,6× moins cher |
Rappel : K3 est troisième sur ce banc en score absolu (1 686 contre 1 747 et 1 736). L'argument est donc bien un argument de rapport qualité/prix, pas de supériorité.
AA-Briefcase¶
Deuxième meilleur score, derrière Claude Fable 5, pour environ la moitié de son coût.
La conclusion du rapport¶
Overall, Kimi K3 sits on or near the cost-efficiency frontier across all four suites, delivering near-top scores at a fraction of the cost of Claude Fable 5 in particular.
Ce que « frontière d'efficacité coût » signifie
Dans un plan score × coût, la frontière de Pareto est l'ensemble des points qu'on ne peut pas améliorer sur un axe sans dégrader l'autre.
Être « sur ou près » de cette frontière signifie : aucun autre modèle ne fait à la fois mieux et moins cher. C'est une affirmation plus faible que « meilleur », mais commercialement plus pertinente.
La contradiction avec Artificial Analysis¶
Deux lectures opposées du même modèle
Artificial Analysis relève chez Kimi K3 une consommation élevée de jetons de sortie, une vitesse de génération inférieure à la médiane, et une tarification premium relativement aux autres modèles ouverts.
Le rapport de Moonshot conclut à une excellente efficacité coût.
Les deux peuvent être vrais simultanément, et voici pourquoi :
| Point de comparaison | Verdict |
|---|---|
| K3 face aux modèles propriétaires de frontière | Bon marché (moitié à un tiers du prix) |
| K3 face aux autres modèles ouverts | Cher (premium, et il consomme plus de jetons) |
| K3 en latence | Lent (beaucoup de jetons de raisonnement, génération sous la médiane) |
Moonshot compare au premier groupe. Artificial Analysis situe dans l'ensemble du marché.
La formulation honnête
Kimi K3 est le modèle le moins cher de son niveau de capacité, et le plus cher et le plus lent parmi les modèles ouverts. Ces deux affirmations ne se contredisent pas : elles décrivent sa position réelle.
Le coût de l'auto-hébergement¶
L'analyse coût/score porte sur l'usage par API. L'auto-hébergement change complètement l'équation.
| Poste | Ordre de grandeur |
|---|---|
| Téléchargement des poids | 1,56 To |
| GPU nécessaires | Cluster multi-nœuds, ~20+ GPU de classe H100/H200 |
| Coût d'infrastructure | Des dizaines de milliers de dollars par mois |
| Coût marginal par jeton | Quasi nul, une fois le cluster amorti |
Quand l'auto-hébergement devient rentable
Le calcul est simple : à 3 $/M jetons en entrée et 15 $/M en sortie, il faut consommer un volume considérable pour amortir un cluster. L'auto-hébergement se justifie surtout pour deux raisons non économiques :
- souveraineté des données — aucune requête ne quitte l'infrastructure ;
- garantie de disponibilité — pas de dépendance à un fournisseur.
C'est le vrai argument des poids ouverts, et la licence l'autorise explicitement pour l'usage interne, sans condition de revenu. Voir Licence.
Vérification de compréhension¶
Pourquoi K3 consomme-t-il beaucoup de jetons de sortie ?
Parce qu'il fonctionne toujours en mode réflexion, et que toutes les
évaluations publiées sont à effort max. Le raisonnement est facturé comme
jetons de sortie, au tarif le plus élevé (15 $/M). C'est aussi pourquoi les
modes high et low ont une valeur économique réelle.
Le tarif de cache à 0,30 $/M change-t-il beaucoup la donne ?
Énormément, en usage agentique. Une session qui relit 400 K jetons de préfixe à chaque tour coûterait 1,20 $ par tour sans cache, contre 0,12 $ avec. Sur une session de 100 tours, l'écart est de 108 $. C'est ce qui justifie tout le travail décrit en Cache de préfixe hybride.
Chapitre précédent : Évaluations tierces · Chapitre suivant : Cybersécurité