llm-architectures-explained

/models

Kimi K2.5

Moonshot AI · Kimi K2 · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2026-01config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceotherconfig.jsonconfig.jsonREADME metadata: license
Total parameters1Tlabmodel cardREADME: Total Parameters 1T
Active parametersnot disclosednot disclosed
Context length256K tokenslabmodel cardREADME: Context Length 256K
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for kimi_k2: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for kimi_k2: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block (MLA normalises its latent vectors, which is not QK-norm)
Positional encodingRoPE on 33.3% of each headconfig.jsonconfig.jsonqk_rope_head_dim / (qk_nope_head_dim + qk_rope_head_dim): decoupled RoPE
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for kimi_k2: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

MLA 64h, latent 512. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Kimi K2.5: layer stack and blockslayers (61)mixer / FFNlayer 0: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 0: Gated MLP: 18432layer 1: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 1: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 2: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 2: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 3: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 3: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 4: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 4: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 5: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 5: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 6: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 6: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 7: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 7: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 8: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 8: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 9: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 9: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 10: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 10: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 11: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 11: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 12: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 12: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 13: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 13: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 14: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 14: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 15: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 15: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 16: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 16: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 17: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 17: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 18: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 18: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 19: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 19: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 20: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 20: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 21: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 21: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 22: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 22: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 23: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 23: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 24: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 24: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 25: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 25: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 26: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 26: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 27: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 27: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 28: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 28: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 29: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 29: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 30: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 30: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 31: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 31: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 32: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 32: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 33: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 33: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 34: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 34: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 35: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 35: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 36: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 36: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 37: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 37: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 38: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 38: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 39: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 39: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 40: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 40: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 41: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 41: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 42: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 42: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 43: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 43: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 44: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 44: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 45: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 45: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 46: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 46: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 47: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 47: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 48: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 48: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 49: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 49: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 50: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 50: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 51: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 51: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 52: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 52: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 53: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 53: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 54: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 54: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 55: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 55: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 56: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 56: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 57: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 57: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 58: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 58: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 59: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 59: MoE: 384 experts, 8 active · expert 2048 · 1 sharedlayer 60: MLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 60: MoE: 384 experts, 8 active · expert 2048 · 1 shared03060× 60normMLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536+normMoE: 384 experts, 8 active · expert 2048 · 1 shared+× 1normMLA: 64 heads · KV latent 512 + RoPE 64 · Q latent 1536+normGated MLP: 18432+MLAdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)1.03T
Active per token (modelled)32.9B
Without embeddings and output head1.02T total, 30.5B active
Published weights (Hugging Face count)1.03T (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)68.6 KiB
KV cache + state at 256K tokens, BF1617.2 GiB
Decode FLOPs per token at 4K context73.6 GFLOP
Prefill FLOPs for a 4K prompt271 TFLOP

KV cache against context

Kimi K2.5: KV cache bytes against context length101001,00010,000100,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)Kimi K2.5

Compare with other models →

Every architecture field

FieldValueSource
d_model7,168config.jsonconfig.jsontext_config.hidden_size
vocab163,840config.jsonconfig.jsontext_config.vocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontext_config.tie_word_embeddings
mixers.mla.typemlacodemodelling codemulti-head latent attention
mixers.mla.heads64config.jsonconfig.jsontext_config.num_attention_heads
mixers.mla.q_lora_rank1,536config.jsonconfig.jsontext_config.q_lora_rank
mixers.mla.kv_lora_rank512config.jsonconfig.jsontext_config.kv_lora_rank
mixers.mla.qk_nope128config.jsonconfig.jsontext_config.qk_nope_head_dim
mixers.mla.qk_rope64config.jsonconfig.jsontext_config.qk_rope_head_dim
mixers.mla.v_head_dim128config.jsonconfig.jsontext_config.v_head_dim
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff18,432config.jsonconfig.jsontext_config.intermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts384config.jsonconfig.jsontext_config.n_routed_experts
ffns.moe.active8config.jsonconfig.jsontext_config.num_experts_per_tok
ffns.moe.d_expert2,048config.jsonconfig.jsontext_config.moe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1config.jsonconfig.jsontext_config.n_shared_experts
ffns.moe.d_shared2,048config.jsonconfig.jsontext_config.moe_intermediate_size
layout1× mla/dense · 60× mla/moeconfig.jsonconfig.jsontext_config.num_hidden_layers, first_k_dense_replace

Sources

Listed in the LLM Architecture Gallery checklist as “Kimi K2.5 (1T)” (name only; see about).