Sources¶
Toutes les références utilisées dans ce wiki, classées par type et par niveau de fiabilité.
Principe
Aucune source n'est inventée. Chaque affirmation chiffrée de ce wiki provient soit d'une des sources ci-dessous, soit d'un calcul explicité et vérifiable dans Reproduire.
Sources primaires — Moonshot AI¶
Ce sont les sources de référence, mais elles émanent du constructeur et ne constituent pas des évaluations indépendantes.
| Source | Adresse | Usage dans ce wiki |
|---|---|---|
| Rapport technique Kimi K3 | arXiv 2607.24653 | La source principale. Soumis le 27 juillet 2026, signé « Kimi Team », 400+ contributeurs |
| Source LaTeX du rapport | arXiv /src/2607.24653 | Lue intégralement : 8 sections, annexes, 4 tableaux d'évaluation |
| Poids du modèle | huggingface.co/moonshotai/Kimi-K3 | 118 fichiers, 1,56 To — taille vérifiée par l'API HF |
config.json |
Fichier brut | Toutes les valeurs d'architecture de ce wiki |
| LICENSE | Fichier brut | Lue intégralement — chapitre licence |
| Carte de modèle | README | Déploiement, usage, effort de raisonnement |
| Billet technique | kimi.com/blog/kimi-k3 | Tarifs, disponibilité, limitations reconnues |
Dépôts de code ouverts¶
| Dépôt | Adresse | Contenu |
|---|---|---|
| MoonEP | github.com/MoonshotAI/MoonEP | Parallélisme d'experts à équilibre parfait |
| AgentENV | github.com/kvcache-ai/AgentENV | Sandboxes microVM |
| MiniTriton | github.com/MoonshotAI/minitriton | Compilateur écrit par Kimi K3 |
| nano-kpu | github.com/MoonshotAI/nano-kpu | RTL de la puce conçue par Kimi K3 |
| KDA dans FLA | PR #691 | Implémentation de KCP |
Évaluations indépendantes¶
Les sources les plus fiables du dossier.
| Organisation | Nature | Résultat pour Kimi K3 |
|---|---|---|
| Artificial Analysis | Indice composite d'intelligence | 57,1 — #4 sur 580 modèles |
| Vals AI | Bancs sectoriels pondérés par le PIB | 74,7 % — #2 sur 39 |
| LMArena | Préférence humaine en aveugle | WebDev #1/99 · Text #8/200 · Agent #4/37 |
| UK AI Security Institute + NIST CAISI | Évaluation gouvernementale conjointe des capacités cyber | ExploitBench 32 % vs 24 % (GLM-5.2) ; 17/32 étapes ; 0/41 exécution de code arbitraire |
Le rapport de l'UK AISI est référencé dans la bibliographie du papier : aisi.gov.uk/blog/preliminary-assessment-of-kimi-k3s-cyber-capabilities
Travaux antérieurs cités¶
Les briques dont Kimi K3 dépend directement.
Série Kimi¶
| Travail | Référence |
|---|---|
| Kimi k1.5 | arXiv 2501.12599 |
| Kimi K2 | arXiv 2507.20534 |
| Kimi Linear (origine de KDA) | arXiv 2510.26692 |
| Kimi K2.5 | Cité sans eprint dans la bibliographie |
| Attention Residuals | Cité sans eprint dans la bibliographie |
Lecture indispensable pour réimplémenter
Kimi Linear contient la dérivation de la transformation UT de la forme par blocs de KDA — que le rapport K3 ne reprend pas.
Architecture¶
| Travail | Référence | Apport |
|---|---|---|
| DeepSeek-V2 | arXiv 2405.04434 | MLA |
| DeepSeekMoE | arXiv 2401.06066 | Experts partagés + routés |
| DeepSeek-V3 | arXiv 2412.19437 | Routage sans perte auxiliaire |
| LatentMoE | arXiv 2601.18089 | Espace latent des experts |
| DeltaNet | Schlag et al., ICML 2021 | Règle delta |
| Gated DeltaNet | Yang et al., 2025 | Base directe de KDA |
| Gated Attention | arXiv 2505.06708 | Portes de sortie |
| Quantile Balancing | spaces.ac.cn/archives/11619 | Billet de blog de Su Jianlin |
| Microscaling (MXFP4) | arXiv 2310.10537 | Formats de basse précision |
Entraînement et inférence¶
| Travail | Référence |
|---|---|
| EAGLE-3 | arXiv 2503.01840 |
| LK Losses | arXiv 2602.23881 |
| Low-Precision Transformer Training Fails | arXiv 2510.04212 |
| On-policy distillation | thinkingmachines.ai/blog/on-policy-distillation |
| Mooncake | arXiv 2407.00079 |
| Firecracker | Agache et al., NSDI 2020 |
| WarpDecode | cursor.com/blog/warp-decode |
| ReplaySSM | tridao.me/blog/2026/replayssm |
| Muon | Jordan et al., 2024 |
Modèles de comparaison¶
| Modèle | Annonce |
|---|---|
| Claude Fable 5 | anthropic.com |
| GPT-5.6 Sol | openai.com |
| GLM-5.2 | z.ai/blog/glm-5.2 |
Sources secondaires et critiques¶
Statut de ces sources
Analyses de presse spécialisée et de blogs techniques. Utiles pour la contradiction et le contexte, mais de fiabilité variable. Ce wiki les cite en signalant systématiquement leurs limites.
| Source | Apport | Réserve |
|---|---|---|
| Simon Willison — simonwillison.net | Analyse de la licence, taille réelle du dépôt (1,56 To) | Impressions rapides, pas de mesure |
| NxCode — nxcode.io | Critique du mélange des harnais dans les scores de codage | Blog commercial |
| Kili Technology — kili-technology.com | Écart labo/production ; 36 % d'échec sur scénarios dynamiques | Méthodologie non détaillée, non reproductible — traité comme indication qualitative |
| Tom's Hardware | Couverture générale de la sortie | Presse généraliste tech |
| Pandaily, Geopolitechs, Medium | Analyses de contexte | Fiabilité variable, non utilisées pour des chiffres |
Une erreur récurrente de la presse spécialisée
Plusieurs articles annoncent un téléchargement de « ~594 Go ».
C'est faux. Vérification directe par l'API Hugging Face : la somme des 118 fichiers vaut 1 560 998 984 390 octets, soit 1,56 To. Ce chiffre est cohérent avec l'arithmétique MXFP4 (2,72 T de paramètres à ~4,25 bits effectifs ≈ 1,44 To, plus les composants non quantifiés en BF16).
Retenir 1,56 To.
Vérifications propres à ce wiki¶
Les résultats suivants ont été calculés et testés pour ce wiki, et ne proviennent d'aucune source externe.
| Vérification | Résultat | Méthode |
|---|---|---|
| Décompte des paramètres | 2,779 T / 104,0 G | Reconstruction depuis config.json |
| Identité de composition KCP | erreur \(6{,}94\times10^{-18}\) | Récurrence explicite en Python pur |
| Balayage préfixe KCP, 4 rangs | erreur \(1{,}39\times10^{-17}\) | Idem |
| Borne de SiTU-GLU | max = 100,000 sur 200 000 tirages | Échantillonnage dans \([-500,500]^2\) |
| Accord local SiTU / SwiGLU | écart relatif < 0,53 % | Échantillonnage dans \([-0{,}5,0{,}5]^2\) |
| Convergence de Quantile Balancing | 10,5 % → 2,7 % en 8 pas, sans hyperparamètre | 4 096 jetons, 16 experts |
| Taille du dépôt Hugging Face | 1 560 998 984 390 octets | API HF, ?blobs=true |
| Configuration nano-K3 | 190,8 M / 45,1 M | Même fonction de comptage |
Script complet : verif-kimi-k3.py — Python pur, aucune dépendance.
Une vérification qui ne confirme pas le rapport
Notre reproduction de Quantile Balancing à petite échelle confirme le mécanisme (forte réduction dès le premier pas, aucun hyperparamètre) mais ne reproduit pas l'avantage net sur la règle par signe que le rapport revendique à ~\(10^3\) experts.
Le régime concerné (896 experts, lots de millions de jetons) n'est pas atteignable dans ce cadre. Nous rapportons le résultat tel qu'obtenu.
Comment citer ce wiki¶
Analyse détaillée de Kimi K3 — bibliothèque mkdocs.reaper.mx
https://mkdocs.reaper.mx/intelligence-artificielle/modeles/kimi-k3/
Créé le 29 juillet 2026. Sources primaires : arXiv 2607.24653 et
huggingface.co/moonshotai/Kimi-K3.
Retour aux annexes