llm-architectures-explained

/models

Mellum2 12B-A2.5B Thinking

JetBrains · Mellum · open weights

Facts and where they come from

Released2026-05config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters12Blabmodel cardmodel name Mellum2-12B-A2.5B
Active parameters2.5Blabmodel cardmodel name ...-A2.5B
Context length128K tokenslabmodel cardREADME: Context Length: 131,072
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for mellum: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for mellum: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normyescodemodelling codetransformers 5.18.0 mellum: q_norm and k_norm
Positional encodingRoPEcodemodelling coderotary on the full head (default)
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for mellum: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

21× GQA 32q/4kv, window 1024 + 7× GQA 32q/4kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Mellum2 12B-A2.5B Thinking: layer stack and blockslayers (28)mixer / FFNlayer 0: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 0: MoE: 64 experts, 8 active · expert 896layer 1: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 1: MoE: 64 experts, 8 active · expert 896layer 2: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 2: MoE: 64 experts, 8 active · expert 896layer 3: GQA: 32 query / 4 KV heads · head 128layer 3: MoE: 64 experts, 8 active · expert 896layer 4: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 4: MoE: 64 experts, 8 active · expert 896layer 5: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 5: MoE: 64 experts, 8 active · expert 896layer 6: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 6: MoE: 64 experts, 8 active · expert 896layer 7: GQA: 32 query / 4 KV heads · head 128layer 7: MoE: 64 experts, 8 active · expert 896layer 8: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 8: MoE: 64 experts, 8 active · expert 896layer 9: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 9: MoE: 64 experts, 8 active · expert 896layer 10: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 10: MoE: 64 experts, 8 active · expert 896layer 11: GQA: 32 query / 4 KV heads · head 128layer 11: MoE: 64 experts, 8 active · expert 896layer 12: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 12: MoE: 64 experts, 8 active · expert 896layer 13: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 13: MoE: 64 experts, 8 active · expert 896layer 14: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 14: MoE: 64 experts, 8 active · expert 896layer 15: GQA: 32 query / 4 KV heads · head 128layer 15: MoE: 64 experts, 8 active · expert 896layer 16: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 16: MoE: 64 experts, 8 active · expert 896layer 17: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 17: MoE: 64 experts, 8 active · expert 896layer 18: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 18: MoE: 64 experts, 8 active · expert 896layer 19: GQA: 32 query / 4 KV heads · head 128layer 19: MoE: 64 experts, 8 active · expert 896layer 20: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 20: MoE: 64 experts, 8 active · expert 896layer 21: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 21: MoE: 64 experts, 8 active · expert 896layer 22: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 22: MoE: 64 experts, 8 active · expert 896layer 23: GQA: 32 query / 4 KV heads · head 128layer 23: MoE: 64 experts, 8 active · expert 896layer 24: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 24: MoE: 64 experts, 8 active · expert 896layer 25: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 25: MoE: 64 experts, 8 active · expert 896layer 26: GQA: 32 query / 4 KV heads · head 128 · window 1,024layer 26: MoE: 64 experts, 8 active · expert 896layer 27: GQA: 32 query / 4 KV heads · head 128layer 27: MoE: 64 experts, 8 active · expert 89601427× 21normGQA: 32 query / 4 KV heads · head 128 · window 1,024+normMoE: 64 experts, 8 active · expert 896+× 7normGQA: 32 query / 4 KV heads · head 128+normMoE: 64 experts, 8 active · expert 896+sliding windowfull attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)12.1B
Active per token (modelled)2.44B
Without embeddings and output head11.7B total, 1.99B active
Published weights (Hugging Face count)12.1B
KV cache per token, BF16 (layers that grow with context)14 KiB
KV cache + state at 128K tokens, BF161.79 GiB
Decode FLOPs per token at 4K context5.25 GFLOP
Prefill FLOPs for a 4K prompt18.5 TFLOP

KV cache against context

Mellum2 12B-A2.5B Thinking: KV cache bytes against context length101001,00010,000100,000980 KiB9.5 MiB95 MiB950 MiBcontext (tokens)KV cache + state (BF16)Mellum2 12B-A2.5B Thinking

Compare with other models →

Every architecture field

FieldValueSource
d_model2,304config.jsonconfig.jsonhidden_size
vocab98,304config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads32config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 mellum: q_norm and k_norm
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads32config.jsonconfig.jsonnum_attention_heads
mixers.sliding.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.sliding.head_dim128config.jsonconfig.jsonhead_dim
mixers.sliding.window1,024config.jsonconfig.jsonsliding_window
mixers.sliding.qk_normtruecodemodelling codetransformers 5.18.0 mellum: q_norm and k_norm
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff7,168config.jsonconfig.jsonintermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts64config.jsonconfig.jsonnum_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert896config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moeconfig.jsonconfig.jsonlayer_types, mlp_layer_types

Sources

Listed in the LLM Architecture Gallery checklist as “JetBrains Mellum2 Thinking (12B-A2.5B)” (name only; see about).