Aller au contenu

Fiche technique complète

Toutes les valeurs de cette page proviennent soit du rapport technique (arXiv 2607.24653), soit du fichier config.json publié sur Hugging Face. La colonne Source l'indique.

Modèle de langage

Caractéristique Valeur Source
Architecture Mixture-of-Experts, décodeur seul Rapport
Paramètres totaux 2,78 T (2 779 milliards reconstruits) Rapport + config
Paramètres activés par jeton 104,2 B (104,0 reconstruits) Rapport + config
Rapport de rareté (experts) 56 (\(896/16\)) Rapport
Couches 93 num_hidden_layers: 93
Couches denses (non-MoE) 1 (la première) first_k_dense_replace: 1
Dimension cachée \(d\) 7 168 hidden_size
Dimension intermédiaire dense 33 792 intermediate_size
Vocabulaire 163 840 vocab_size
Contexte maximal 1 048 576 jetons max_position_embeddings
Type de calcul bfloat16 dtype
Poids liés entrée/sortie Non tie_word_embeddings: false
Couches MTP 0 dans le dépôt public (1 selon le rapport) num_nextn_predict_layers: 0

Attention

Caractéristique Valeur Source
Composition 69 KDA + 24 Gated MLA Rapport + full_attn_layers
Motif 3 KDA : 1 MLA, plus 1 MLA finale Rapport
Indices des couches MLA 4, 8, 12, …, 88, 92, 93 full_attn_layers
Têtes d'attention 96 num_attention_heads
Dimension par tête 128 head_dim, v_head_dim
Encodage de position NoPE sur MLA mla_use_nope: true
Porte de sortie MLA Oui, rang plein mla_use_output_gate: true
Rang latent KV (MLA) 512 kv_lora_rank
Rang latent Q (MLA) 1 536 q_lora_rank
Dimensions QK (nope / rope) 128 / 64 qk_nope_head_dim, qk_rope_head_dim
Noyau de convolution courte (KDA) 4 short_conv_kernel_size
Plancher de décroissance \(g_{\min}\) −5,0 gate_lower_bound
Porte KDA de rang plein Oui use_full_rank_gate: true

Une curiosité de la configuration

qk_rope_head_dim: 64 est présent alors que mla_use_nope: true. La dimension est donc allouée dans la projection mais l'encodage rotatif n'est pas appliqué. C'est probablement un héritage de la structure MLA de DeepSeek conservée pour compatibilité de code. À vérifier dans modeling_kimi_linear.py si l'on réimplémente.

Mixture-of-Experts

Caractéristique Valeur Source
Experts routés par couche 896 num_experts
Experts actifs par jeton 16 num_experts_per_token
Experts partagés 2 num_shared_experts
Dimension latente MoE \(\ell\) 3 584 (\(0{,}5\times d\)) routed_expert_hidden_size
Dimension interne d'un expert 3 072 moe_intermediate_size
Activation SiTU-GLU hidden_act: "situ"
\(\beta_1\) (branche porte) 4,0 activation_situ_beta
\(\beta_2\) (branche montante) 25,0 activation_situ_linear_beta
Activation du routeur Sigmoïde moe_router_activation_func
Méthode Top-\(k\) noaux_tc (sans perte auxiliaire) topk_method
Renormalisation des poids Oui moe_renormalize: true
Normalisation LatentMoE Oui (RMSNorm avant \(\mathbf{W}^{\uparrow}\)) latent_moe_use_norm: true
Fréquence des couches MoE Toutes (sauf la couche dense) moe_layer_freq: 1

Attention Residuals

Caractéristique Valeur Source
Taille de bloc 12 couches attn_res_block_size
Nombre de blocs 8 (le dernier partiel), 9 sources avec l'embedding Rapport
Forme utilisée Block AttnRes (pas Full) Rapport

Encodeur visuel — MoonViT-V2

Caractéristique Valeur Source
Paramètres 401 M Rapport
Couches 27 vt_num_hidden_layers
Dimension cachée 1 024 vt_hidden_size
Dimension intermédiaire 4 096 vt_intermediate_size
Têtes 12 vt_num_attention_heads
Taille de carreau 14 × 14 patch_size
Normalisation RMSNorm norm_type
Activation GELU (tanh) activation_func
Biais Aucun linear_bias: false, attn_bias: false
Fusion avant projection 2 × 2 (pixel-shuffle) merge_kernel_size
Projecteur patchmergerv2, activation GELU mm_projector_type
Résolution maximale 3 584 × 3 584 px Rapport
Initialisation Depuis zéro, prédiction du jeton suivant Rapport

Quantification

Caractéristique Valeur Source
Format des poids d'experts MXFP4 quantization_config
Bits 4 num_bits
Taille de groupe 32 group_size
Symétrique Oui symmetric: true
Observateur min-max observer
Activations MXFP8 Rapport
Méthode QAT dès le SFT Rapport
Modules exclus attention, experts partagés, FFN dense, lm_head, ViT, projecteur ignore

Entraînement

Caractéristique Valeur Source
Optimiseur Per-Head Muon (+ weight clipping) Rapport
Weight decay 0,1 Rapport
Calendrier de LR Cosinus, warmup linéaire 1 % Rapport
Équilibrage MoE Quantile Balancing Rapport
Curriculum de contexte 8 K → 64 K → 256 K → 1 M Rapport
Domaines de données texte Web, Code, Mathématiques, Connaissance Rapport
Nombre de jetons d'entraînement Non publié —
Budget de calcul (FLOPs) Non publié —

Comparaison K2 → K3

Kimi K2 Kimi K3 Δ
Couches 61 93 +52 %
Paramètres totaux 1,04 T 2,78 T +167 %
Paramètres activés 32,6 B 104,2 B +220 %
Dimension cachée 7 168 7 168 =
Dimension latente MoE — 3 584 (0,5×) nouveau
Dim. interne par expert 2 048 3 072 +50 %
Experts routés 384 896 +133 %
Experts actifs 8 16 +100 %
Experts partagés 1 2 +100 %
Têtes d'attention 64 96 +50 %
Couches denses 1 1 =
Vocabulaire 160 K 160 K =
Contexte d'entraînement 128 K 1 M ×8
Attention MLA Hybride KDA–MLA —
Activation SwiGLU SiTU-GLU —
Couches d'attention 61 MLA 69 KDA + 24 MLA —
Couches MTP 1 1 =
ViT — 401 M, 27 couches nouveau

Lecture de ce tableau

La dimension cachée n'a pas bougé. Tout l'élargissement est passé par la profondeur (+52 %), le nombre d'experts (+133 %) et le nombre d'experts actifs (+100 %). C'est exactement la thèse du rapport : scaler le flux d'information selon trois axes — séquence (KDA), profondeur (AttnRes), largeur (LatentMoE) — plutôt que de gonfler \(d\).

Déploiement

Caractéristique Valeur
Taille du dépôt Hugging Face 1,56 To (118 fichiers)
Format Safetensors, compressed-tensors
Moteurs recommandés vLLM, SGLang, TokenSpeed
API platform.kimi.ai, modèle kimi-k3, compatible OpenAI/Anthropic
Effort de raisonnement low, high, max (défaut max)
Réflexion Toujours active, renvoie reasoning_content
Tarif entrée (cache manqué) 3,00 $ / M jetons
Tarif entrée (cache touché) 0,30 $ / M jetons
Tarif sortie 15,00 $ / M jetons

Configuration d'évaluation recommandée

Type de tâche Température top-p
Raisonnement et connaissance 1,0 0,95
Code et agentique 1,0 1,0

Chapitre précédent : Ce que Kimi K3 annonce · Chapitre suivant : Licence et disponibilité