Licence et disponibilité¶
La « Kimi K3 License »¶
Les poids et le code sont publiés sous une licence rédigée par Moonshot AI, appelée simplement Kimi K3 License. Elle tient en une page.
Ce n'est pas une licence open source
Kimi K2 était distribué sous une licence décrite comme « MIT modifiée ».
Kimi K3 ne fait plus cette revendication. Le champ Hugging Face indique
license: other, license_name: kimi-k3.
Simon Willison, qui a couvert la sortie, note que Moonshot « ne tente pas de décrire ceci comme une licence open source » — ce qu'il porte au crédit de l'entreprise, tout en qualifiant les termes de janky.
Ce que la licence autorise¶
Le corps de la licence est une base MIT très permissive. Sont explicitement accordés, à titre gratuit :
- utiliser, copier, modifier, fusionner, publier, distribuer, sous-licencier, vendre des copies ;
- exécuter, déployer, affiner (fine-tune) le logiciel ;
- créer des œuvres dérivées ;
- transmettre ces droits à des tiers.
Le terme « logiciel » couvre explicitement les poids, les paramètres, les fichiers de configuration, le code d'inférence et d'entraînement, et la documentation associée.
Les deux conditions à l'échelle¶
Condition 1 — Model as a Service au-delà de 20 M$
Si le licencié (ou une de ses filiales) exploite une activité de Model as a Service et que le revenu agrégé dépasse 20 millions de dollars sur toute période de 12 mois consécutifs, il doit conclure un accord séparé avec Moonshot AI avant tout usage commercial.
La licence définit précisément « Model as a Service » : donner à un tiers accès à l'inférence ou à l'affinage d'un modèle de langage (par API, par exemple) d'une manière qui lui permette d'exercer un contrôle significatif sur les entrées, les paramètres ou les données d'entraînement.
Sont exclus de cette définition : (a) les produits pour utilisateur final où les capacités du modèle sont intégrées uniquement dans des fonctionnalités ou harnais spécifiques ; (b) le simple relais de requêtes vers des modèles hébergés par des tiers.
Condition 2 — Attribution visible aux très grandes échelles
Si un produit ou service commercial du licencié dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenu mensuel, la mention « Kimi K3 » doit être affichée de manière visible dans l'interface utilisateur.
Les exemptions¶
Les deux conditions ci-dessus ne s'appliquent pas à :
- l'usage interne, défini comme tout usage qui ne met ni le logiciel, ni ses sorties, ni ses capacités sous-jacentes à disposition de tiers ;
- tout usage via les produits officiels de Moonshot AI ou ses partenaires d'inférence certifiés.
Ce que cela signifie en pratique¶
| Cas d'usage | Autorisé sans accord ? |
|---|---|
| Recherche académique | ✅ Oui |
| Usage interne en entreprise, quel que soit le chiffre d'affaires | ✅ Oui (exemption « usage interne ») |
| Produit SaaS intégrant K3 dans une fonctionnalité | ✅ Oui (exclu de la définition MaaS) |
| Revendre l'accès brut à l'API du modèle, < 20 M$ de CA | ✅ Oui |
| Revendre l'accès brut à l'API, > 20 M$ de CA | ❌ Accord requis |
| Produit à > 100 M d'utilisateurs mensuels | ✅ Oui, avec mention « Kimi K3 » visible |
| Affiner et redistribuer un dérivé | ✅ Oui, avec la notice de licence |
Comparaison
Ces conditions ressemblent à celles de Llama 2/3 (seuil de 700 M d'utilisateurs) et de plusieurs licences « open weights ». Elles visent les concurrents directs qui revendraient le modèle comme service, pas les utilisateurs ordinaires. Mais elles suffisent à disqualifier l'appellation « open source » au sens de l'Open Source Initiative, qui interdit toute discrimination selon le domaine d'usage ou l'échelle.
Aucune garantie n'est fournie (clause « AS IS » standard). Contact indiqué pour
toute question : [email protected].
Où obtenir le modèle¶
| Canal | Adresse |
|---|---|
| Poids | huggingface.co/moonshotai/Kimi-K3 |
| Miroir chinois | ModelScope, organisation moonshotai |
| Rapport technique | arXiv 2607.24653 |
| Billet de blog | kimi.com/blog/kimi-k3 |
| API | platform.kimi.ai, modèle kimi-k3 |
| Interface | kimi.com, Kimi Work, Kimi Code |
Le coût matériel de l'auto-hébergement¶
Chiffres contradictoires dans la presse spécialisée
Plusieurs articles annoncent un téléchargement de « ~594 Go ». Ce chiffre est incompatible avec la réalité du dépôt.
Vérification directe via l'API Hugging Face : la somme des tailles des 118 fichiers du dépôt vaut 1 560 998 984 390 octets, soit 1,56 To.
Ce chiffre est cohérent avec l'arithmétique : 2,78 T de paramètres dont
~2,72 T en MXFP4 (4 bits + échelle par bloc de 32, soit ~4,25 bits
effectifs) donne environ 1,44 To, auxquels s'ajoutent les composants non
quantifiés (attention, experts partagés, lm_head, ViT) en BF16.
Retenir 1,56 To, pas 594 Go.
Ordres de grandeur pour l'inférence¶
Il faut loger les poids plus le cache KV, les états KDA et les tampons d'exécution.
| Configuration | Faisabilité |
|---|---|
| 1 × H100 (80 Go) | ❌ Impossible, quel que soit le format |
| 8 × H100 (640 Go) | ❌ Insuffisant pour les poids seuls |
| 20 à 24 × H100/H200 | ✅ Ordre de grandeur réaliste, avec parallélisme tensoriel + experts |
| Quantifications communautaires plus agressives | Disponibles via llama.cpp, Ollama, LM Studio, au prix d'une dégradation non mesurée par Moonshot |
Prudence sur les chiffres de configuration matérielle
Les recommandations précises (« 22 × H100 », « 8 × H100 avec TP+EP combinés ») circulent dans des articles secondaires et ne figurent pas dans le rapport ni dans la carte de modèle officielle. Les recettes officielles sont chez vLLM, SGLang et TokenSpeed. Ce sont elles qui font foi.
Le coût par l'API¶
| Poste | Tarif |
|---|---|
| Entrée, cache touché | 0,30 $ / M jetons |
| Entrée, cache manqué | 3,00 $ / M jetons |
| Sortie | 15,00 $ / M jetons |
Le tarif est plat sur toute la fenêtre de contexte — il n'y a pas de majoration au-delà d'un certain seuil, contrairement à plusieurs concurrents.
Le facteur 10 du cache
Dans un usage agentique où le même préfixe est relu des centaines de fois, l'écart 0,30 $ / 3,00 $ domine la facture. C'est ce qui rend le cache de préfixe hybride économiquement central, et non simplement élégant.
Le modèle est aussi disponible via des agrégateurs (OpenRouter notamment), à des tarifs alignés.
Chapitre précédent : Fiche technique complète
Fin de la partie Présentation. Suite : Architecture.