Aller au contenu

Tableau des spécifications

Toutes les valeurs numériques de Kimi K3, sur une page. Chaque ligne porte sa source.

Légende : cfg = config.json publié · rap = rapport technique · hf = API Hugging Face · calc = recalculé dans ce wiki · blog = billet officiel

Vue d'ensemble

Caractéristique Valeur Source
Nom Kimi K3 —
Éditeur Moonshot AI —
Date de publication 27 juillet 2026 arXiv
Type MoE multimodal natif, décodeur seul rap
Paramètres totaux 2,78 T (2,779 T reconstruits) rap / calc
Paramètres activés 104,2 G (104,0 G reconstruits) rap / calc
Rareté 56 rap
Contexte 1 048 576 jetons cfg
Modalités Texte, image, vidéo rap
Licence Kimi K3 License (pas open source) hf
Taille du dépôt 1 560 998 984 390 octets = 1,56 To hf
Nombre de fichiers 118 hf

Modèle de langage

Caractéristique Valeur Source
Couches 93 cfg
Couches denses 1 (la première) cfg
Dimension cachée \(d\) 7 168 cfg
Dimension intermédiaire dense 33 792 cfg
Vocabulaire 163 840 cfg
Type de calcul bfloat16 cfg
Poids liés entrée/sortie non cfg
\(\epsilon\) de RMSNorm 1e-5 cfg
Couches MTP 0 dans le dépôt (1 selon le rapport) cfg / rap
bos / eos / pad 163584 / 163586 / 163839 cfg
Jeton d'image 163605 cfg

Attention

Caractéristique Valeur Source
Composition 69 KDA + 24 Gated MLA cfg
Motif 3 KDA : 1 MLA, + 1 MLA finale rap
Indices MLA 4, 8, …, 88, 92, 93 cfg
Têtes 96 cfg
Dimension par tête 128 cfg
NoPE sur MLA oui cfg
Porte de sortie MLA oui, rang plein cfg
Rang latent KV 512 cfg
Rang latent Q 1 536 cfg
QK nope / rope 128 / 64 cfg
Dimension V 128 cfg
Noyau ShortConv (KDA) 4 cfg
\(g_{\min}\) −5,0 cfg
Porte KDA de rang plein oui cfg
Paramètres / couche MLA ~232 M calc
Paramètres / couche KDA ~440 M calc
État KDA / requête ~217 Mio, indépendant de \(T\) calc
Cache MLA à 1 M ~29 Gio en BF16 calc

Mixture-of-Experts

Caractéristique Valeur Source
Experts routés 896 cfg
Experts actifs 16 cfg
Experts partagés 2 cfg
Dimension latente \(\ell\) 3 584 (\(0{,}5\,d\)) cfg
Dimension interne d'expert 3 072 cfg
Activation SiTU-GLU cfg
\(\beta_1\) / \(\beta_2\) 4,0 / 25,0 cfg
Borne de sortie \(\beta_1\beta_2 = 100\) rap / calc
Routeur sigmoïde cfg
Méthode Top-\(k\) noaux_tc cfg
Renormalisation oui cfg
RMSNorm LatentMoE oui cfg
Paramètres / expert 33,0 M calc
Paramètres / couche MoE 29,78 G calc
Actifs / couche MoE 718 M calc
Total des experts routés 2 723 G, soit 98 % du modèle calc

Attention Residuals

Caractéristique Valeur Source
Taille de bloc 12 couches cfg
Nombre de blocs 8 (dernier partiel) rap
Sources max 9 (avec l'embedding) rap
Paramètres ajoutés ~667 K (0,00002 %) calc
Forme Block AttnRes rap

Vision — MoonViT-V2

Caractéristique Valeur Source
Paramètres 401 M rap
Couches 27 cfg
Dimension cachée 1 024 cfg
Dimension intermédiaire 4 096 cfg
Têtes 12 cfg
Carreau 14 × 14 px cfg
Normalisation RMSNorm cfg
Activation GELU (tanh) cfg
Biais aucun cfg
Fusion 2 × 2 pixel-shuffle cfg
Projecteur patchmergerv2, GELU cfg
Résolution max 3 584 × 3 584 px rap
Jetons pour une image max 16 384 (1,6 % du contexte) calc
Initialisation depuis zéro, prédiction du jeton suivant rap

Quantification

Caractéristique Valeur Source
Format des poids d'experts MXFP4 cfg
Bits 4 cfg
Taille de groupe 32 cfg
Symétrique oui cfg
Observateur min-max cfg
Activations MXFP8 rap
Méthode QAT dès le SFT rap
Exclus attention, experts partagés, FFN dense, lm_head, ViT, projecteur cfg
Facteur de compression réel ~3,6× (5,6 To → 1,56 To) calc

Entraînement

Caractéristique Valeur Source
Optimiseur Per-Head Muon + weight clipping rap
Weight decay 0,1 rap
Calendrier de LR cosinus rap
Warmup linéaire, 1 % rap
Équilibrage MoE Quantile Balancing rap
Casiers d'histogramme QB ~1 000 rap
Curriculum de contexte 8 K → 64 K → 256 K → 1 M rap
Domaines texte Web, Code, Maths, Connaissance rap
Jetons d'entraînement non publié —
Taille de lot non publiée —
Taux d'apprentissage non publié —
TPP non publié —
GPU, durée, FLOPs non publiés —

Post-entraînement

Caractéristique Valeur Source
Étapes SFT → RL → MOPD rap
Domaines RL 3 (général, agent, code) rap
Niveaux d'effort 3 (low, high, max) rap
Experts RL 9 rap
Format de conversation XTML rap
Canaux think, response, tools rap
Réflexion toujours active, préservée hf
Sandboxes créées 51 219 741 rap
Images de sandbox 1 505 678 rap
Checkpoint / reprise sandbox 133 ms / 49 ms rap
Surengagement mémoire jusqu'à 6,5× rap
Algorithme RL non publié —

Inférence et service

Caractéristique Valeur Source
Moteurs recommandés vLLM, SGLang, TokenSpeed hf
API platform.kimi.ai, modèle kimi-k3 hf
Compatibilité OpenAI et Anthropic hf
Effort par défaut max hf
Bloc de hachage du cache 512 jetons rap
Bloc physique 1 024–6 144 jetons rap
Tarif entrée (cache) 0,30 $ / M blog
Tarif entrée (hors cache) 3,00 $ / M blog
Tarif sortie 15,00 $ / M blog
Tarif selon la longueur plat blog

Évaluation

Caractéristique Valeur Source
Température recommandée 1,0 rap
top-p (raisonnement) 0,95 rap
top-p (code, agentique) 1,0 rap
Artificial Analysis v4.1 57,1 — #4/580 tiers
Vals Index 74,7 % — #2/39 tiers
WebDev Arena 1 678 Elo — #1/99 tiers
Text Arena 1 486 Elo — #8/200 tiers
Agent Arena 9,1 — #4/37 tiers
ExploitBench (UK AISI) 32 % (vs 24 % GLM-5.2) tiers

nano-K3 (modèle jouet de ce wiki)

Caractéristique Valeur
\(d\) 512
Couches 13 (9 KDA + 4 MLA)
Têtes 8 × 64
\(\ell\) / dim. expert 256 / 256
Experts 64, dont 4 actifs, 2 partagés
Bloc AttnRes 4
Vocabulaire 8 192
Contexte 2 048
Paramètres totaux 190,8 M
Paramètres actifs 45,1 M

→ nano-K3


Retour aux annexes