llm-architectures-explained

/models

MiMo-V2.5

Xiaomi · MiMo-V2 · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2026-04config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parameters310Blabmodel cardREADME: 310B total / 15B activated parameters
Active parameters15Blabmodel cardREADME: 15B activated
Context length1M tokenslabmodel cardREADME: up to 1M tokens
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPE on 33.4% of each headconfig.jsonconfig.jsonpartial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

9× GQA 64q/4kv + 39× GQA 64q/8kv, window 128. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

MiMo-V2.5: layer stack and blockslayers (48)mixer / FFNlayer 0: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 0: Gated MLP: 16384layer 1: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 1: MoE: 256 experts, 8 active · expert 2048layer 2: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 2: MoE: 256 experts, 8 active · expert 2048layer 3: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 3: MoE: 256 experts, 8 active · expert 2048layer 4: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 4: MoE: 256 experts, 8 active · expert 2048layer 5: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 5: MoE: 256 experts, 8 active · expert 2048layer 6: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 6: MoE: 256 experts, 8 active · expert 2048layer 7: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 7: MoE: 256 experts, 8 active · expert 2048layer 8: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 8: MoE: 256 experts, 8 active · expert 2048layer 9: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 9: MoE: 256 experts, 8 active · expert 2048layer 10: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 10: MoE: 256 experts, 8 active · expert 2048layer 11: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 11: MoE: 256 experts, 8 active · expert 2048layer 12: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 12: MoE: 256 experts, 8 active · expert 2048layer 13: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 13: MoE: 256 experts, 8 active · expert 2048layer 14: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 14: MoE: 256 experts, 8 active · expert 2048layer 15: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 15: MoE: 256 experts, 8 active · expert 2048layer 16: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 16: MoE: 256 experts, 8 active · expert 2048layer 17: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 17: MoE: 256 experts, 8 active · expert 2048layer 18: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 18: MoE: 256 experts, 8 active · expert 2048layer 19: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 19: MoE: 256 experts, 8 active · expert 2048layer 20: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 20: MoE: 256 experts, 8 active · expert 2048layer 21: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 21: MoE: 256 experts, 8 active · expert 2048layer 22: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 22: MoE: 256 experts, 8 active · expert 2048layer 23: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 23: MoE: 256 experts, 8 active · expert 2048layer 24: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 24: MoE: 256 experts, 8 active · expert 2048layer 25: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 25: MoE: 256 experts, 8 active · expert 2048layer 26: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 26: MoE: 256 experts, 8 active · expert 2048layer 27: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 27: MoE: 256 experts, 8 active · expert 2048layer 28: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 28: MoE: 256 experts, 8 active · expert 2048layer 29: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 29: MoE: 256 experts, 8 active · expert 2048layer 30: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 30: MoE: 256 experts, 8 active · expert 2048layer 31: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 31: MoE: 256 experts, 8 active · expert 2048layer 32: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 32: MoE: 256 experts, 8 active · expert 2048layer 33: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 33: MoE: 256 experts, 8 active · expert 2048layer 34: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 34: MoE: 256 experts, 8 active · expert 2048layer 35: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 35: MoE: 256 experts, 8 active · expert 2048layer 36: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 36: MoE: 256 experts, 8 active · expert 2048layer 37: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 37: MoE: 256 experts, 8 active · expert 2048layer 38: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 38: MoE: 256 experts, 8 active · expert 2048layer 39: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 39: MoE: 256 experts, 8 active · expert 2048layer 40: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 40: MoE: 256 experts, 8 active · expert 2048layer 41: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 41: MoE: 256 experts, 8 active · expert 2048layer 42: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 42: MoE: 256 experts, 8 active · expert 2048layer 43: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 43: MoE: 256 experts, 8 active · expert 2048layer 44: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 44: MoE: 256 experts, 8 active · expert 2048layer 45: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 45: MoE: 256 experts, 8 active · expert 2048layer 46: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 46: MoE: 256 experts, 8 active · expert 2048layer 47: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 47: MoE: 256 experts, 8 active · expert 204802447× 39normGQA: 64 query / 8 KV heads · head 192 (V 128) · window 128+normMoE: 256 experts, 8 active · expert 2048+× 8normGQA: 64 query / 4 KV heads · head 192 (V 128)+normMoE: 256 experts, 8 active · expert 2048+× 1normGQA: 64 query / 4 KV heads · head 192 (V 128)+normGated MLP: 16384+full attentionsliding windowdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)309B
Active per token (modelled)15.4B
Without embeddings and output head308B total, 14.2B active
Published weights (Hugging Face count)311B
KV cache per token, BF16 (layers that grow with context)22.5 KiB
KV cache + state at 1M tokens, BF1622.5 GiB
Decode FLOPs per token at 4K context31.4 GFLOP
Prefill FLOPs for a 4K prompt120 TFLOP

KV cache against context

MiMo-V2.5: KV cache bytes against context length101001,00010,000100,0001,000,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)MiMo-V2.5

Compare with other models →

Every architecture field

FieldValueSource
d_model4,096config.jsonconfig.jsonhidden_size
vocab152,576config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads64config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim192config.jsonconfig.jsonhead_dim
mixers.full.v_head_dim128config.jsonconfig.jsonv_head_dim
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads64config.jsonconfig.jsonswa_num_attention_heads
mixers.sliding.kv_heads8config.jsonconfig.jsonswa_num_key_value_heads
mixers.sliding.head_dim192config.jsonconfig.jsonswa_head_dim
mixers.sliding.window128config.jsonconfig.jsonsliding_window
mixers.sliding.v_head_dim128config.jsonconfig.jsonswa_v_head_dim
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff16,384config.jsonconfig.jsonintermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts256config.jsonconfig.jsonn_routed_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert2,048config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout1× full/dense · 4× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moeconfig.jsonconfig.jsonhybrid_layer_pattern (0 = full, 1 = sliding), moe_layer_freq

Sources

Listed in the LLM Architecture Gallery checklist as “Xiaomi MiMo-V2.5 (310B)” (name only; see about).