Fiche technique complète
Toutes les valeurs de cette page proviennent soit du rapport technique
(arXiv 2607.24653), soit du fichier config.json publié sur Hugging Face. La
colonne Source l'indique.
Modèle de langage
| Caractéristique |
Valeur |
Source |
| Architecture |
Mixture-of-Experts, décodeur seul |
Rapport |
| Paramètres totaux |
2,78 T (2 779 milliards reconstruits) |
Rapport + config |
| Paramètres activés par jeton |
104,2 B (104,0 reconstruits) |
Rapport + config |
| Rapport de rareté (experts) |
56 (\(896/16\)) |
Rapport |
| Couches |
93 |
num_hidden_layers: 93 |
| Couches denses (non-MoE) |
1 (la première) |
first_k_dense_replace: 1 |
| Dimension cachée \(d\) |
7 168 |
hidden_size |
| Dimension intermédiaire dense |
33 792 |
intermediate_size |
| Vocabulaire |
163 840 |
vocab_size |
| Contexte maximal |
1 048 576 jetons |
max_position_embeddings |
| Type de calcul |
bfloat16 |
dtype |
| Poids liés entrée/sortie |
Non |
tie_word_embeddings: false |
| Couches MTP |
0 dans le dépôt public (1 selon le rapport) |
num_nextn_predict_layers: 0 |
Attention
| Caractéristique |
Valeur |
Source |
| Composition |
69 KDA + 24 Gated MLA |
Rapport + full_attn_layers |
| Motif |
3 KDA : 1 MLA, plus 1 MLA finale |
Rapport |
| Indices des couches MLA |
4, 8, 12, …, 88, 92, 93 |
full_attn_layers |
| Têtes d'attention |
96 |
num_attention_heads |
| Dimension par tête |
128 |
head_dim, v_head_dim |
| Encodage de position |
NoPE sur MLA |
mla_use_nope: true |
| Porte de sortie MLA |
Oui, rang plein |
mla_use_output_gate: true |
| Rang latent KV (MLA) |
512 |
kv_lora_rank |
| Rang latent Q (MLA) |
1 536 |
q_lora_rank |
| Dimensions QK (nope / rope) |
128 / 64 |
qk_nope_head_dim, qk_rope_head_dim |
| Noyau de convolution courte (KDA) |
4 |
short_conv_kernel_size |
| Plancher de décroissance \(g_{\min}\) |
−5,0 |
gate_lower_bound |
| Porte KDA de rang plein |
Oui |
use_full_rank_gate: true |
Une curiosité de la configuration
qk_rope_head_dim: 64 est présent alors que mla_use_nope: true. La
dimension est donc allouée dans la projection mais l'encodage rotatif
n'est pas appliqué. C'est probablement un héritage de la structure MLA de
DeepSeek conservée pour compatibilité de code. À vérifier dans
modeling_kimi_linear.py si l'on réimplémente.
Mixture-of-Experts
| Caractéristique |
Valeur |
Source |
| Experts routés par couche |
896 |
num_experts |
| Experts actifs par jeton |
16 |
num_experts_per_token |
| Experts partagés |
2 |
num_shared_experts |
| Dimension latente MoE \(\ell\) |
3 584 (\(0{,}5\times d\)) |
routed_expert_hidden_size |
| Dimension interne d'un expert |
3 072 |
moe_intermediate_size |
| Activation |
SiTU-GLU |
hidden_act: "situ" |
| \(\beta_1\) (branche porte) |
4,0 |
activation_situ_beta |
| \(\beta_2\) (branche montante) |
25,0 |
activation_situ_linear_beta |
| Activation du routeur |
Sigmoïde |
moe_router_activation_func |
| Méthode Top-\(k\) |
noaux_tc (sans perte auxiliaire) |
topk_method |
| Renormalisation des poids |
Oui |
moe_renormalize: true |
| Normalisation LatentMoE |
Oui (RMSNorm avant \(\mathbf{W}^{\uparrow}\)) |
latent_moe_use_norm: true |
| Fréquence des couches MoE |
Toutes (sauf la couche dense) |
moe_layer_freq: 1 |
Attention Residuals
| Caractéristique |
Valeur |
Source |
| Taille de bloc |
12 couches |
attn_res_block_size |
| Nombre de blocs |
8 (le dernier partiel), 9 sources avec l'embedding |
Rapport |
| Forme utilisée |
Block AttnRes (pas Full) |
Rapport |
Encodeur visuel — MoonViT-V2
| Caractéristique |
Valeur |
Source |
| Paramètres |
401 M |
Rapport |
| Couches |
27 |
vt_num_hidden_layers |
| Dimension cachée |
1 024 |
vt_hidden_size |
| Dimension intermédiaire |
4 096 |
vt_intermediate_size |
| Têtes |
12 |
vt_num_attention_heads |
| Taille de carreau |
14 × 14 |
patch_size |
| Normalisation |
RMSNorm |
norm_type |
| Activation |
GELU (tanh) |
activation_func |
| Biais |
Aucun |
linear_bias: false, attn_bias: false |
| Fusion avant projection |
2 × 2 (pixel-shuffle) |
merge_kernel_size |
| Projecteur |
patchmergerv2, activation GELU |
mm_projector_type |
| Résolution maximale |
3 584 × 3 584 px |
Rapport |
| Initialisation |
Depuis zéro, prédiction du jeton suivant |
Rapport |
Quantification
| Caractéristique |
Valeur |
Source |
| Format des poids d'experts |
MXFP4 |
quantization_config |
| Bits |
4 |
num_bits |
| Taille de groupe |
32 |
group_size |
| Symétrique |
Oui |
symmetric: true |
| Observateur |
min-max |
observer |
| Activations |
MXFP8 |
Rapport |
| Méthode |
QAT dès le SFT |
Rapport |
| Modules exclus |
attention, experts partagés, FFN dense, lm_head, ViT, projecteur |
ignore |
Entraînement
| Caractéristique |
Valeur |
Source |
| Optimiseur |
Per-Head Muon (+ weight clipping) |
Rapport |
| Weight decay |
0,1 |
Rapport |
| Calendrier de LR |
Cosinus, warmup linéaire 1 % |
Rapport |
| Équilibrage MoE |
Quantile Balancing |
Rapport |
| Curriculum de contexte |
8 K → 64 K → 256 K → 1 M |
Rapport |
| Domaines de données texte |
Web, Code, Mathématiques, Connaissance |
Rapport |
| Nombre de jetons d'entraînement |
Non publié |
— |
| Budget de calcul (FLOPs) |
Non publié |
— |
Comparaison K2 → K3
|
Kimi K2 |
Kimi K3 |
Δ |
| Couches |
61 |
93 |
+52 % |
| Paramètres totaux |
1,04 T |
2,78 T |
+167 % |
| Paramètres activés |
32,6 B |
104,2 B |
+220 % |
| Dimension cachée |
7 168 |
7 168 |
= |
| Dimension latente MoE |
— |
3 584 (0,5×) |
nouveau |
| Dim. interne par expert |
2 048 |
3 072 |
+50 % |
| Experts routés |
384 |
896 |
+133 % |
| Experts actifs |
8 |
16 |
+100 % |
| Experts partagés |
1 |
2 |
+100 % |
| Têtes d'attention |
64 |
96 |
+50 % |
| Couches denses |
1 |
1 |
= |
| Vocabulaire |
160 K |
160 K |
= |
| Contexte d'entraînement |
128 K |
1 M |
×8 |
| Attention |
MLA |
Hybride KDA–MLA |
— |
| Activation |
SwiGLU |
SiTU-GLU |
— |
| Couches d'attention |
61 MLA |
69 KDA + 24 MLA |
— |
| Couches MTP |
1 |
1 |
= |
| ViT |
— |
401 M, 27 couches |
nouveau |
Lecture de ce tableau
La dimension cachée n'a pas bougé. Tout l'élargissement est passé par
la profondeur (+52 %), le nombre d'experts (+133 %) et le nombre d'experts
actifs (+100 %). C'est exactement la thèse du rapport : scaler le flux
d'information selon trois axes — séquence (KDA), profondeur (AttnRes),
largeur (LatentMoE) — plutôt que de gonfler \(d\).
Déploiement
| Caractéristique |
Valeur |
| Taille du dépôt Hugging Face |
1,56 To (118 fichiers) |
| Format |
Safetensors, compressed-tensors |
| Moteurs recommandés |
vLLM, SGLang, TokenSpeed |
| API |
platform.kimi.ai, modèle kimi-k3, compatible OpenAI/Anthropic |
| Effort de raisonnement |
low, high, max (défaut max) |
| Réflexion |
Toujours active, renvoie reasoning_content |
| Tarif entrée (cache manqué) |
3,00 $ / M jetons |
| Tarif entrée (cache touché) |
0,30 $ / M jetons |
| Tarif sortie |
15,00 $ / M jetons |
Configuration d'évaluation recommandée
| Type de tâche |
Température |
top-p |
| Raisonnement et connaissance |
1,0 |
0,95 |
| Code et agentique |
1,0 |
1,0 |
Chapitre précédent : Ce que Kimi K3 annonce ·
Chapitre suivant : Licence et disponibilité