llm-architectures-explained

/models

MiMo-V2.6-Flash-RL

Xiaomi · MiMo-V2 · open weights

Facts and where they come from

Released2026-09config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parameters309Blabmodel cardREADME: 309B total / 15B activated parameters
Active parameters15Blabmodel cardREADME: 15B activated
Context length1M tokenslabmodel cardREADME: 1M tokens
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPE on 33.4% of each headconfig.jsonconfig.jsonrope_parameters.partial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for mimo_v2: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

9× GQA 64q/4kv + 39× GQA 64q/8kv, window 128. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

MiMo-V2.6-Flash-RL: layer stack and blockslayers (48)mixer / FFNlayer 0: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 0: Gated MLP: 16384layer 1: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 1: MoE: 256 experts, 8 active · expert 2048layer 2: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 2: MoE: 256 experts, 8 active · expert 2048layer 3: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 3: MoE: 256 experts, 8 active · expert 2048layer 4: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 4: MoE: 256 experts, 8 active · expert 2048layer 5: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 5: MoE: 256 experts, 8 active · expert 2048layer 6: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 6: MoE: 256 experts, 8 active · expert 2048layer 7: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 7: MoE: 256 experts, 8 active · expert 2048layer 8: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 8: MoE: 256 experts, 8 active · expert 2048layer 9: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 9: MoE: 256 experts, 8 active · expert 2048layer 10: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 10: MoE: 256 experts, 8 active · expert 2048layer 11: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 11: MoE: 256 experts, 8 active · expert 2048layer 12: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 12: MoE: 256 experts, 8 active · expert 2048layer 13: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 13: MoE: 256 experts, 8 active · expert 2048layer 14: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 14: MoE: 256 experts, 8 active · expert 2048layer 15: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 15: MoE: 256 experts, 8 active · expert 2048layer 16: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 16: MoE: 256 experts, 8 active · expert 2048layer 17: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 17: MoE: 256 experts, 8 active · expert 2048layer 18: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 18: MoE: 256 experts, 8 active · expert 2048layer 19: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 19: MoE: 256 experts, 8 active · expert 2048layer 20: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 20: MoE: 256 experts, 8 active · expert 2048layer 21: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 21: MoE: 256 experts, 8 active · expert 2048layer 22: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 22: MoE: 256 experts, 8 active · expert 2048layer 23: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 23: MoE: 256 experts, 8 active · expert 2048layer 24: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 24: MoE: 256 experts, 8 active · expert 2048layer 25: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 25: MoE: 256 experts, 8 active · expert 2048layer 26: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 26: MoE: 256 experts, 8 active · expert 2048layer 27: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 27: MoE: 256 experts, 8 active · expert 2048layer 28: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 28: MoE: 256 experts, 8 active · expert 2048layer 29: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 29: MoE: 256 experts, 8 active · expert 2048layer 30: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 30: MoE: 256 experts, 8 active · expert 2048layer 31: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 31: MoE: 256 experts, 8 active · expert 2048layer 32: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 32: MoE: 256 experts, 8 active · expert 2048layer 33: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 33: MoE: 256 experts, 8 active · expert 2048layer 34: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 34: MoE: 256 experts, 8 active · expert 2048layer 35: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 35: MoE: 256 experts, 8 active · expert 2048layer 36: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 36: MoE: 256 experts, 8 active · expert 2048layer 37: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 37: MoE: 256 experts, 8 active · expert 2048layer 38: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 38: MoE: 256 experts, 8 active · expert 2048layer 39: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 39: MoE: 256 experts, 8 active · expert 2048layer 40: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 40: MoE: 256 experts, 8 active · expert 2048layer 41: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 41: MoE: 256 experts, 8 active · expert 2048layer 42: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 42: MoE: 256 experts, 8 active · expert 2048layer 43: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 43: MoE: 256 experts, 8 active · expert 2048layer 44: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 44: MoE: 256 experts, 8 active · expert 2048layer 45: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 45: MoE: 256 experts, 8 active · expert 2048layer 46: GQA: 64 query / 8 KV heads · head 192 (V 128) · window 128layer 46: MoE: 256 experts, 8 active · expert 2048layer 47: GQA: 64 query / 4 KV heads · head 192 (V 128)layer 47: MoE: 256 experts, 8 active · expert 204802447× 39normGQA: 64 query / 8 KV heads · head 192 (V 128) · window 128+normMoE: 256 experts, 8 active · expert 2048+× 8normGQA: 64 query / 4 KV heads · head 192 (V 128)+normMoE: 256 experts, 8 active · expert 2048+× 1normGQA: 64 query / 4 KV heads · head 192 (V 128)+normGated MLP: 16384+full attentionsliding windowdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)309B
Active per token (modelled)15.4B
Without embeddings and output head308B total, 14.2B active
Multi-token-prediction layers (extra)988M
Published weights (Hugging Face count)311B (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)22.5 KiB
KV cache + state at 1M tokens, BF1622.5 GiB
Decode FLOPs per token at 4K context31.4 GFLOP
Prefill FLOPs for a 4K prompt120 TFLOP

KV cache against context

MiMo-V2.6-Flash-RL: KV cache bytes against context length101001,00010,000100,0001,000,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)MiMo-V2.6-Flash-RL

Compare with other models →

Every architecture field

FieldValueSource
d_model4,096config.jsonconfig.jsonhidden_size
vocab152,576config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads64config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim192config.jsonconfig.jsonhead_dim
mixers.full.v_head_dim128config.jsonconfig.jsonv_head_dim
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads64config.jsonconfig.jsonswa_num_attention_heads
mixers.sliding.kv_heads8config.jsonconfig.jsonswa_num_key_value_heads
mixers.sliding.head_dim192config.jsonconfig.jsonswa_head_dim
mixers.sliding.window128config.jsonconfig.jsonsliding_window
mixers.sliding.v_head_dim128config.jsonconfig.jsonswa_v_head_dim
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff16,384config.jsonconfig.jsonintermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts256config.jsonconfig.jsonn_routed_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert2,048config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout1× full/dense · 4× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moe · 5× sliding/moe · 1× full/moeconfig.jsonconfig.jsonhybrid_layer_pattern (0 = full, 1 = sliding), moe_layer_freq
mtp_layers3config.jsonconfig.jsonnum_nextn_predict_layers
mtp_layer{"mixer":"sliding","ffn":"dense","n":1}codemodelling codeMTP block: sliding-window attention + dense MLP

Sources

Listed in the LLM Architecture Gallery checklist as “Xiaomi MiMo-V2.6-Flash-RL (309B)” (name only; see about).