llm-architectures-explained

/models

MiMo-V2.6-Pro-RL

Xiaomi · MiMo-V2 · open weights

Facts and where they come from

Released2026-09config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parameters1.02Tlabmodel cardREADME: 1.02T total / 42B activated parameters
Active parameters42Blabmodel cardREADME: 42B activated
Context length1M tokenslabmodel cardREADME: 1M tokens
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPE on 33.4% of each headconfig.jsonconfig.jsonrope_parameters.partial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

10× GQA 128q/8kv + 60× GQA 128q/8kv, window 128. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

MiMo-V2.6-Pro-RL: layer stack and blockslayers (70)mixer / FFNlayer 0: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 0: Gated MLP: 16384layer 1: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 1: MoE: 384 experts, 8 active · expert 2048layer 2: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 2: MoE: 384 experts, 8 active · expert 2048layer 3: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 3: MoE: 384 experts, 8 active · expert 2048layer 4: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 4: MoE: 384 experts, 8 active · expert 2048layer 5: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 5: MoE: 384 experts, 8 active · expert 2048layer 6: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 6: MoE: 384 experts, 8 active · expert 2048layer 7: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 7: MoE: 384 experts, 8 active · expert 2048layer 8: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 8: MoE: 384 experts, 8 active · expert 2048layer 9: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 9: MoE: 384 experts, 8 active · expert 2048layer 10: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 10: MoE: 384 experts, 8 active · expert 2048layer 11: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 11: MoE: 384 experts, 8 active · expert 2048layer 12: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 12: MoE: 384 experts, 8 active · expert 2048layer 13: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 13: MoE: 384 experts, 8 active · expert 2048layer 14: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 14: MoE: 384 experts, 8 active · expert 2048layer 15: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 15: MoE: 384 experts, 8 active · expert 2048layer 16: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 16: MoE: 384 experts, 8 active · expert 2048layer 17: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 17: MoE: 384 experts, 8 active · expert 2048layer 18: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 18: MoE: 384 experts, 8 active · expert 2048layer 19: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 19: MoE: 384 experts, 8 active · expert 2048layer 20: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 20: MoE: 384 experts, 8 active · expert 2048layer 21: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 21: MoE: 384 experts, 8 active · expert 2048layer 22: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 22: MoE: 384 experts, 8 active · expert 2048layer 23: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 23: MoE: 384 experts, 8 active · expert 2048layer 24: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 24: MoE: 384 experts, 8 active · expert 2048layer 25: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 25: MoE: 384 experts, 8 active · expert 2048layer 26: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 26: MoE: 384 experts, 8 active · expert 2048layer 27: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 27: MoE: 384 experts, 8 active · expert 2048layer 28: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 28: MoE: 384 experts, 8 active · expert 2048layer 29: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 29: MoE: 384 experts, 8 active · expert 2048layer 30: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 30: MoE: 384 experts, 8 active · expert 2048layer 31: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 31: MoE: 384 experts, 8 active · expert 2048layer 32: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 32: MoE: 384 experts, 8 active · expert 2048layer 33: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 33: MoE: 384 experts, 8 active · expert 2048layer 34: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 34: MoE: 384 experts, 8 active · expert 2048layer 35: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 35: MoE: 384 experts, 8 active · expert 2048layer 36: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 36: MoE: 384 experts, 8 active · expert 2048layer 37: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 37: MoE: 384 experts, 8 active · expert 2048layer 38: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 38: MoE: 384 experts, 8 active · expert 2048layer 39: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 39: MoE: 384 experts, 8 active · expert 2048layer 40: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 40: MoE: 384 experts, 8 active · expert 2048layer 41: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 41: MoE: 384 experts, 8 active · expert 2048layer 42: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 42: MoE: 384 experts, 8 active · expert 2048layer 43: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 43: MoE: 384 experts, 8 active · expert 2048layer 44: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 44: MoE: 384 experts, 8 active · expert 2048layer 45: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 45: MoE: 384 experts, 8 active · expert 2048layer 46: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 46: MoE: 384 experts, 8 active · expert 2048layer 47: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 47: MoE: 384 experts, 8 active · expert 2048layer 48: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 48: MoE: 384 experts, 8 active · expert 2048layer 49: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 49: MoE: 384 experts, 8 active · expert 2048layer 50: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 50: MoE: 384 experts, 8 active · expert 2048layer 51: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 51: MoE: 384 experts, 8 active · expert 2048layer 52: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 52: MoE: 384 experts, 8 active · expert 2048layer 53: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 53: MoE: 384 experts, 8 active · expert 2048layer 54: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 54: MoE: 384 experts, 8 active · expert 2048layer 55: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 55: MoE: 384 experts, 8 active · expert 2048layer 56: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 56: MoE: 384 experts, 8 active · expert 2048layer 57: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 57: MoE: 384 experts, 8 active · expert 2048layer 58: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 58: MoE: 384 experts, 8 active · expert 2048layer 59: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 59: MoE: 384 experts, 8 active · expert 2048layer 60: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 60: MoE: 384 experts, 8 active · expert 2048layer 61: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 61: MoE: 384 experts, 8 active · expert 2048layer 62: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 62: MoE: 384 experts, 8 active · expert 2048layer 63: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 63: MoE: 384 experts, 8 active · expert 2048layer 64: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 64: MoE: 384 experts, 8 active · expert 2048layer 65: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 65: MoE: 384 experts, 8 active · expert 2048layer 66: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 66: MoE: 384 experts, 8 active · expert 2048layer 67: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 67: MoE: 384 experts, 8 active · expert 2048layer 68: GQA: 128 query / 8 KV heads · head 192 (V 128) · window 128layer 68: MoE: 384 experts, 8 active · expert 2048layer 69: GQA: 128 query / 8 KV heads · head 192 (V 128)layer 69: MoE: 384 experts, 8 active · expert 204803569× 60normGQA: 128 query / 8 KV heads · head 192 (V 128) · window 128+normMoE: 384 experts, 8 active · expert 2048+× 9normGQA: 128 query / 8 KV heads · head 192 (V 128)+normMoE: 384 experts, 8 active · expert 2048+× 1normGQA: 128 query / 8 KV heads · head 192 (V 128)+normGated MLP: 16384+full attentionsliding windowdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)1.02T
Active per token (modelled)41.9B
Without embeddings and output head1.02T total, 40B active
Published weights (Hugging Face count)1.02T (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)50 KiB
KV cache + state at 1M tokens, BF1650 GiB
Decode FLOPs per token at 4K context85.9 GFLOP
Prefill FLOPs for a 4K prompt337 TFLOP

KV cache against context

MiMo-V2.6-Pro-RL: KV cache bytes against context length101001,00010,000100,0001,000,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)MiMo-V2.6-Pro-RL

Compare with other models →

Every architecture field

FieldValueSource
d_model6,144config.jsonconfig.jsonhidden_size
vocab152,576config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads128config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads8config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim192config.jsonconfig.jsonhead_dim
mixers.full.v_head_dim128config.jsonconfig.jsonv_head_dim
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads128config.jsonconfig.jsonswa_num_attention_heads
mixers.sliding.kv_heads8config.jsonconfig.jsonswa_num_key_value_heads
mixers.sliding.head_dim192config.jsonconfig.jsonswa_head_dim
mixers.sliding.window128config.jsonconfig.jsonsliding_window
mixers.sliding.v_head_dim128config.jsonconfig.jsonswa_v_head_dim
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff16,384config.jsonconfig.jsonintermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts384config.jsonconfig.jsonn_routed_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert2,048config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout1× full/dense · 6× sliding/moe · 1× full/moe · 7× sliding/moe · 1× full/moe · 7× sliding/moe · 1× full/moe · 7× sliding/moe · 1× full/moe · 7× sliding/moe · 1× full/moe · 7× sliding/moe · 1× full/moe · 7× sliding/moe · 1× full/moe · 6× sliding/moe · 1× full/moe · 6× sliding/moe · 1× full/moeconfig.jsonconfig.jsonhybrid_layer_pattern (0 = full, 1 = sliding), moe_layer_freq

Sources

Listed in the LLM Architecture Gallery checklist as “Xiaomi MiMo-V2.6-Pro-RL (1.02T)” (name only; see about).