Tableau des spécifications
Toutes les valeurs numériques de Kimi K3, sur une page. Chaque ligne porte sa
source.
Légende : cfg = config.json publié · rap = rapport technique ·
hf = API Hugging Face · calc = recalculé dans ce wiki ·
blog = billet officiel
Vue d'ensemble
| Caractéristique |
Valeur |
Source |
| Nom |
Kimi K3 |
— |
| Éditeur |
Moonshot AI |
— |
| Date de publication |
27 juillet 2026 |
arXiv |
| Type |
MoE multimodal natif, décodeur seul |
rap |
| Paramètres totaux |
2,78 T (2,779 T reconstruits) |
rap / calc |
| Paramètres activés |
104,2 G (104,0 G reconstruits) |
rap / calc |
| Rareté |
56 |
rap |
| Contexte |
1 048 576 jetons |
cfg |
| Modalités |
Texte, image, vidéo |
rap |
| Licence |
Kimi K3 License (pas open source) |
hf |
| Taille du dépôt |
1 560 998 984 390 octets = 1,56 To |
hf |
| Nombre de fichiers |
118 |
hf |
Modèle de langage
| Caractéristique |
Valeur |
Source |
| Couches |
93 |
cfg |
| Couches denses |
1 (la première) |
cfg |
| Dimension cachée \(d\) |
7 168 |
cfg |
| Dimension intermédiaire dense |
33 792 |
cfg |
| Vocabulaire |
163 840 |
cfg |
| Type de calcul |
bfloat16 |
cfg |
| Poids liés entrée/sortie |
non |
cfg |
| \(\epsilon\) de RMSNorm |
1e-5 |
cfg |
| Couches MTP |
0 dans le dépôt (1 selon le rapport) |
cfg / rap |
bos / eos / pad |
163584 / 163586 / 163839 |
cfg |
| Jeton d'image |
163605 |
cfg |
Attention
| Caractéristique |
Valeur |
Source |
| Composition |
69 KDA + 24 Gated MLA |
cfg |
| Motif |
3 KDA : 1 MLA, + 1 MLA finale |
rap |
| Indices MLA |
4, 8, …, 88, 92, 93 |
cfg |
| Têtes |
96 |
cfg |
| Dimension par tête |
128 |
cfg |
| NoPE sur MLA |
oui |
cfg |
| Porte de sortie MLA |
oui, rang plein |
cfg |
| Rang latent KV |
512 |
cfg |
| Rang latent Q |
1 536 |
cfg |
| QK nope / rope |
128 / 64 |
cfg |
| Dimension V |
128 |
cfg |
| Noyau ShortConv (KDA) |
4 |
cfg |
| \(g_{\min}\) |
−5,0 |
cfg |
| Porte KDA de rang plein |
oui |
cfg |
| Paramètres / couche MLA |
~232 M |
calc |
| Paramètres / couche KDA |
~440 M |
calc |
| État KDA / requête |
~217 Mio, indépendant de \(T\) |
calc |
| Cache MLA à 1 M |
~29 Gio en BF16 |
calc |
Mixture-of-Experts
| Caractéristique |
Valeur |
Source |
| Experts routés |
896 |
cfg |
| Experts actifs |
16 |
cfg |
| Experts partagés |
2 |
cfg |
| Dimension latente \(\ell\) |
3 584 (\(0{,}5\,d\)) |
cfg |
| Dimension interne d'expert |
3 072 |
cfg |
| Activation |
SiTU-GLU |
cfg |
| \(\beta_1\) / \(\beta_2\) |
4,0 / 25,0 |
cfg |
| Borne de sortie |
\(\beta_1\beta_2 = 100\) |
rap / calc |
| Routeur |
sigmoïde |
cfg |
| Méthode Top-\(k\) |
noaux_tc |
cfg |
| Renormalisation |
oui |
cfg |
| RMSNorm LatentMoE |
oui |
cfg |
| Paramètres / expert |
33,0 M |
calc |
| Paramètres / couche MoE |
29,78 G |
calc |
| Actifs / couche MoE |
718 M |
calc |
| Total des experts routés |
2 723 G, soit 98 % du modèle |
calc |
Attention Residuals
| Caractéristique |
Valeur |
Source |
| Taille de bloc |
12 couches |
cfg |
| Nombre de blocs |
8 (dernier partiel) |
rap |
| Sources max |
9 (avec l'embedding) |
rap |
| Paramètres ajoutés |
~667 K (0,00002 %) |
calc |
| Forme |
Block AttnRes |
rap |
Vision — MoonViT-V2
| Caractéristique |
Valeur |
Source |
| Paramètres |
401 M |
rap |
| Couches |
27 |
cfg |
| Dimension cachée |
1 024 |
cfg |
| Dimension intermédiaire |
4 096 |
cfg |
| Têtes |
12 |
cfg |
| Carreau |
14 × 14 px |
cfg |
| Normalisation |
RMSNorm |
cfg |
| Activation |
GELU (tanh) |
cfg |
| Biais |
aucun |
cfg |
| Fusion |
2 × 2 pixel-shuffle |
cfg |
| Projecteur |
patchmergerv2, GELU |
cfg |
| Résolution max |
3 584 × 3 584 px |
rap |
| Jetons pour une image max |
16 384 (1,6 % du contexte) |
calc |
| Initialisation |
depuis zéro, prédiction du jeton suivant |
rap |
Quantification
| Caractéristique |
Valeur |
Source |
| Format des poids d'experts |
MXFP4 |
cfg |
| Bits |
4 |
cfg |
| Taille de groupe |
32 |
cfg |
| Symétrique |
oui |
cfg |
| Observateur |
min-max |
cfg |
| Activations |
MXFP8 |
rap |
| Méthode |
QAT dès le SFT |
rap |
| Exclus |
attention, experts partagés, FFN dense, lm_head, ViT, projecteur |
cfg |
| Facteur de compression réel |
~3,6× (5,6 To → 1,56 To) |
calc |
Entraînement
| Caractéristique |
Valeur |
Source |
| Optimiseur |
Per-Head Muon + weight clipping |
rap |
| Weight decay |
0,1 |
rap |
| Calendrier de LR |
cosinus |
rap |
| Warmup |
linéaire, 1 % |
rap |
| Équilibrage MoE |
Quantile Balancing |
rap |
| Casiers d'histogramme QB |
~1 000 |
rap |
| Curriculum de contexte |
8 K → 64 K → 256 K → 1 M |
rap |
| Domaines texte |
Web, Code, Maths, Connaissance |
rap |
| Jetons d'entraînement |
non publié |
— |
| Taille de lot |
non publiée |
— |
| Taux d'apprentissage |
non publié |
— |
| TPP |
non publié |
— |
| GPU, durée, FLOPs |
non publiés |
— |
Post-entraînement
| Caractéristique |
Valeur |
Source |
| Étapes |
SFT → RL → MOPD |
rap |
| Domaines RL |
3 (général, agent, code) |
rap |
| Niveaux d'effort |
3 (low, high, max) |
rap |
| Experts RL |
9 |
rap |
| Format de conversation |
XTML |
rap |
| Canaux |
think, response, tools |
rap |
| Réflexion |
toujours active, préservée |
hf |
| Sandboxes créées |
51 219 741 |
rap |
| Images de sandbox |
1 505 678 |
rap |
| Checkpoint / reprise sandbox |
133 ms / 49 ms |
rap |
| Surengagement mémoire |
jusqu'à 6,5× |
rap |
| Algorithme RL |
non publié |
— |
Inférence et service
| Caractéristique |
Valeur |
Source |
| Moteurs recommandés |
vLLM, SGLang, TokenSpeed |
hf |
| API |
platform.kimi.ai, modèle kimi-k3 |
hf |
| Compatibilité |
OpenAI et Anthropic |
hf |
| Effort par défaut |
max |
hf |
| Bloc de hachage du cache |
512 jetons |
rap |
| Bloc physique |
1 024–6 144 jetons |
rap |
| Tarif entrée (cache) |
0,30 $ / M |
blog |
| Tarif entrée (hors cache) |
3,00 $ / M |
blog |
| Tarif sortie |
15,00 $ / M |
blog |
| Tarif selon la longueur |
plat |
blog |
Évaluation
| Caractéristique |
Valeur |
Source |
| Température recommandée |
1,0 |
rap |
| top-p (raisonnement) |
0,95 |
rap |
| top-p (code, agentique) |
1,0 |
rap |
| Artificial Analysis v4.1 |
57,1 — #4/580 |
tiers |
| Vals Index |
74,7 % — #2/39 |
tiers |
| WebDev Arena |
1 678 Elo — #1/99 |
tiers |
| Text Arena |
1 486 Elo — #8/200 |
tiers |
| Agent Arena |
9,1 — #4/37 |
tiers |
| ExploitBench (UK AISI) |
32 % (vs 24 % GLM-5.2) |
tiers |
nano-K3 (modèle jouet de ce wiki)
| Caractéristique |
Valeur |
| \(d\) |
512 |
| Couches |
13 (9 KDA + 4 MLA) |
| Têtes |
8 × 64 |
| \(\ell\) / dim. expert |
256 / 256 |
| Experts |
64, dont 4 actifs, 2 partagés |
| Bloc AttnRes |
4 |
| Vocabulaire |
8 192 |
| Contexte |
2 048 |
| Paramètres totaux |
190,8 M |
| Paramètres actifs |
45,1 M |
→ nano-K3
Retour aux annexes