llm-architectures-explained

/models

North Mini Code 1.0

Cohere · Command A · open weights

Facts and where they come from

Released2026-06config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters30Blabmodel cardREADME: 30B total; 3B active
Active parameters3Blabmodel cardREADME: 3B active
Context length256K tokenslabmodel cardREADME: context length 256K
Norm placementparallelcodemodelling codetransformers 5.18.0 cohere2_moe: a single input_layernorm feeds attention and the MoE
Norm typeLayerNormcodemodelling codetransformers 5.18.0 cohere2_moe: a single input_layernorm feeds attention and the MoE
QK-normnoconfig.jsonconfig.jsonuse_qk_norm
Positional encodingRoPE; full-attention layers have no RoPE; sliding-window layers use itcodemodelling codetransformers 5.18.0 cohere2_moe: RoPE applied only when the layer has a sliding window
Parallel attention and MLPyescodemodelling codetransformers 5.18.0 cohere2_moe: a single input_layernorm feeds attention and the MoE

Architecture, drawn from the data

13× GQA 32q/4kv + 36× GQA 32q/4kv, window 4096. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

North Mini Code 1.0: layer stack and blockslayers (49)mixer / FFNlayer 0: GQA: 32 query / 4 KV heads · head 128layer 0: Gated MLP: 3072layer 1: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 1: MoE: 128 experts, 8 active · expert 768layer 2: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 2: MoE: 128 experts, 8 active · expert 768layer 3: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 3: MoE: 128 experts, 8 active · expert 768layer 4: GQA: 32 query / 4 KV heads · head 128layer 4: MoE: 128 experts, 8 active · expert 768layer 5: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 5: MoE: 128 experts, 8 active · expert 768layer 6: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 6: MoE: 128 experts, 8 active · expert 768layer 7: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 7: MoE: 128 experts, 8 active · expert 768layer 8: GQA: 32 query / 4 KV heads · head 128layer 8: MoE: 128 experts, 8 active · expert 768layer 9: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 9: MoE: 128 experts, 8 active · expert 768layer 10: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 10: MoE: 128 experts, 8 active · expert 768layer 11: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 11: MoE: 128 experts, 8 active · expert 768layer 12: GQA: 32 query / 4 KV heads · head 128layer 12: MoE: 128 experts, 8 active · expert 768layer 13: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 13: MoE: 128 experts, 8 active · expert 768layer 14: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 14: MoE: 128 experts, 8 active · expert 768layer 15: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 15: MoE: 128 experts, 8 active · expert 768layer 16: GQA: 32 query / 4 KV heads · head 128layer 16: MoE: 128 experts, 8 active · expert 768layer 17: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 17: MoE: 128 experts, 8 active · expert 768layer 18: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 18: MoE: 128 experts, 8 active · expert 768layer 19: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 19: MoE: 128 experts, 8 active · expert 768layer 20: GQA: 32 query / 4 KV heads · head 128layer 20: MoE: 128 experts, 8 active · expert 768layer 21: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 21: MoE: 128 experts, 8 active · expert 768layer 22: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 22: MoE: 128 experts, 8 active · expert 768layer 23: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 23: MoE: 128 experts, 8 active · expert 768layer 24: GQA: 32 query / 4 KV heads · head 128layer 24: MoE: 128 experts, 8 active · expert 768layer 25: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 25: MoE: 128 experts, 8 active · expert 768layer 26: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 26: MoE: 128 experts, 8 active · expert 768layer 27: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 27: MoE: 128 experts, 8 active · expert 768layer 28: GQA: 32 query / 4 KV heads · head 128layer 28: MoE: 128 experts, 8 active · expert 768layer 29: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 29: MoE: 128 experts, 8 active · expert 768layer 30: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 30: MoE: 128 experts, 8 active · expert 768layer 31: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 31: MoE: 128 experts, 8 active · expert 768layer 32: GQA: 32 query / 4 KV heads · head 128layer 32: MoE: 128 experts, 8 active · expert 768layer 33: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 33: MoE: 128 experts, 8 active · expert 768layer 34: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 34: MoE: 128 experts, 8 active · expert 768layer 35: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 35: MoE: 128 experts, 8 active · expert 768layer 36: GQA: 32 query / 4 KV heads · head 128layer 36: MoE: 128 experts, 8 active · expert 768layer 37: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 37: MoE: 128 experts, 8 active · expert 768layer 38: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 38: MoE: 128 experts, 8 active · expert 768layer 39: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 39: MoE: 128 experts, 8 active · expert 768layer 40: GQA: 32 query / 4 KV heads · head 128layer 40: MoE: 128 experts, 8 active · expert 768layer 41: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 41: MoE: 128 experts, 8 active · expert 768layer 42: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 42: MoE: 128 experts, 8 active · expert 768layer 43: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 43: MoE: 128 experts, 8 active · expert 768layer 44: GQA: 32 query / 4 KV heads · head 128layer 44: MoE: 128 experts, 8 active · expert 768layer 45: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 45: MoE: 128 experts, 8 active · expert 768layer 46: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 46: MoE: 128 experts, 8 active · expert 768layer 47: GQA: 32 query / 4 KV heads · head 128 · window 4,096layer 47: MoE: 128 experts, 8 active · expert 768layer 48: GQA: 32 query / 4 KV heads · head 128layer 48: MoE: 128 experts, 8 active · expert 76802448× 36normGQA: 32 query / 4 KV heads · head 128 · window 4,096MoE: 128 experts, 8 active · expert 768+× 12normGQA: 32 query / 4 KV heads · head 128MoE: 128 experts, 8 active · expert 768+× 1normGQA: 32 query / 4 KV heads · head 128Gated MLP: 3072+full attentionsliding windowdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)30.5B
Active per token (modelled)3.31B
Without embeddings and output head29.9B total, 2.77B active
Published weights (Hugging Face count)30.5B
KV cache per token, BF16 (layers that grow with context)26 KiB
KV cache + state at 256K tokens, BF166.78 GiB
Decode FLOPs per token at 4K context9.9 GFLOP
Prefill FLOPs for a 4K prompt29.4 TFLOP

KV cache against context

North Mini Code 1.0: KV cache bytes against context length101001,00010,000100,000980 KiB9.5 MiB95 MiB950 MiBcontext (tokens)KV cache + state (BF16)North Mini Code 1.0

Compare with other models →

Every architecture field

FieldValueSource
d_model2,048config.jsonconfig.jsonhidden_size
vocab262,144config.jsonconfig.jsonvocab_size
tied_embeddingstruecodemodelling codetransformers 5.18.0 cohere2_moe: tie_word_embeddings default true
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads32config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads32config.jsonconfig.jsonnum_attention_heads
mixers.sliding.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.sliding.head_dim128config.jsonconfig.jsonhead_dim
mixers.sliding.window4,096config.jsonconfig.jsonsliding_window
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff3,072config.jsonconfig.jsonprefix_dense_intermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts128config.jsonconfig.jsonnum_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert768config.jsonconfig.jsonintermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout1× full/dense · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moeconfig.jsonconfig.jsonlayer_types, first_k_dense_replace
norms_per_layer1codemodelling codetransformers 5.18.0 cohere2_moe: one LayerNorm per parallel block

Sources

Listed in the LLM Architecture Gallery checklist as “North Mini Code (30B-A3B)” (name only; see about).