llm-architectures-explained

/models

Nemotron 3 Super

NVIDIA · Nemotron 3 · open weights

Facts and where they come from

Released2026-03config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceotherconfig.jsonconfig.jsonREADME metadata: license
Total parameters120Blabmodel cardREADME: 120B Total / 12B Active
Active parameters12Blabmodel cardREADME: 12B Active
Context length1M tokenslabmodel cardREADME: up to 1M tokens
Norm placementprecodemodelling codetransformers 5.18.0 nemotron_h: one norm before each mixer or MLP block
Norm typeRMSNormcodemodelling codetransformers 5.18.0 nemotron_h: one norm before each mixer or MLP block
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPEconfig.jsonconfig.jsonpartial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 nemotron_h: one norm before each mixer or MLP block

Architecture, drawn from the data

40× Mamba-2 + 8× GQA 32q/2kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Nemotron 3 Super: layer stack and blockslayers (88)mixer / FFNlayer 0: Mamba-2: 128 heads × 64 · state 128layer 0: no FFNlayer 1: no mixerlayer 1: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 2: Mamba-2: 128 heads × 64 · state 128layer 2: no FFNlayer 3: no mixerlayer 3: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 4: Mamba-2: 128 heads × 64 · state 128layer 4: no FFNlayer 5: no mixerlayer 5: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 6: Mamba-2: 128 heads × 64 · state 128layer 6: no FFNlayer 7: GQA: 32 query / 2 KV heads · head 128layer 7: no FFNlayer 8: no mixerlayer 8: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 9: Mamba-2: 128 heads × 64 · state 128layer 9: no FFNlayer 10: no mixerlayer 10: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 11: Mamba-2: 128 heads × 64 · state 128layer 11: no FFNlayer 12: no mixerlayer 12: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 13: Mamba-2: 128 heads × 64 · state 128layer 13: no FFNlayer 14: no mixerlayer 14: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 15: Mamba-2: 128 heads × 64 · state 128layer 15: no FFNlayer 16: GQA: 32 query / 2 KV heads · head 128layer 16: no FFNlayer 17: no mixerlayer 17: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 18: Mamba-2: 128 heads × 64 · state 128layer 18: no FFNlayer 19: no mixerlayer 19: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 20: Mamba-2: 128 heads × 64 · state 128layer 20: no FFNlayer 21: no mixerlayer 21: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 22: Mamba-2: 128 heads × 64 · state 128layer 22: no FFNlayer 23: no mixerlayer 23: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 24: Mamba-2: 128 heads × 64 · state 128layer 24: no FFNlayer 25: GQA: 32 query / 2 KV heads · head 128layer 25: no FFNlayer 26: no mixerlayer 26: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 27: Mamba-2: 128 heads × 64 · state 128layer 27: no FFNlayer 28: no mixerlayer 28: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 29: Mamba-2: 128 heads × 64 · state 128layer 29: no FFNlayer 30: no mixerlayer 30: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 31: Mamba-2: 128 heads × 64 · state 128layer 31: no FFNlayer 32: no mixerlayer 32: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 33: Mamba-2: 128 heads × 64 · state 128layer 33: no FFNlayer 34: no mixerlayer 34: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 35: Mamba-2: 128 heads × 64 · state 128layer 35: no FFNlayer 36: GQA: 32 query / 2 KV heads · head 128layer 36: no FFNlayer 37: no mixerlayer 37: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 38: Mamba-2: 128 heads × 64 · state 128layer 38: no FFNlayer 39: no mixerlayer 39: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 40: Mamba-2: 128 heads × 64 · state 128layer 40: no FFNlayer 41: no mixerlayer 41: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 42: Mamba-2: 128 heads × 64 · state 128layer 42: no FFNlayer 43: no mixerlayer 43: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 44: Mamba-2: 128 heads × 64 · state 128layer 44: no FFNlayer 45: no mixerlayer 45: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 46: Mamba-2: 128 heads × 64 · state 128layer 46: no FFNlayer 47: GQA: 32 query / 2 KV heads · head 128layer 47: no FFNlayer 48: no mixerlayer 48: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 49: Mamba-2: 128 heads × 64 · state 128layer 49: no FFNlayer 50: no mixerlayer 50: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 51: Mamba-2: 128 heads × 64 · state 128layer 51: no FFNlayer 52: no mixerlayer 52: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 53: Mamba-2: 128 heads × 64 · state 128layer 53: no FFNlayer 54: no mixerlayer 54: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 55: Mamba-2: 128 heads × 64 · state 128layer 55: no FFNlayer 56: no mixerlayer 56: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 57: Mamba-2: 128 heads × 64 · state 128layer 57: no FFNlayer 58: GQA: 32 query / 2 KV heads · head 128layer 58: no FFNlayer 59: no mixerlayer 59: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 60: Mamba-2: 128 heads × 64 · state 128layer 60: no FFNlayer 61: no mixerlayer 61: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 62: Mamba-2: 128 heads × 64 · state 128layer 62: no FFNlayer 63: no mixerlayer 63: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 64: Mamba-2: 128 heads × 64 · state 128layer 64: no FFNlayer 65: no mixerlayer 65: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 66: Mamba-2: 128 heads × 64 · state 128layer 66: no FFNlayer 67: no mixerlayer 67: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 68: Mamba-2: 128 heads × 64 · state 128layer 68: no FFNlayer 69: GQA: 32 query / 2 KV heads · head 128layer 69: no FFNlayer 70: no mixerlayer 70: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 71: Mamba-2: 128 heads × 64 · state 128layer 71: no FFNlayer 72: no mixerlayer 72: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 73: Mamba-2: 128 heads × 64 · state 128layer 73: no FFNlayer 74: no mixerlayer 74: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 75: Mamba-2: 128 heads × 64 · state 128layer 75: no FFNlayer 76: no mixerlayer 76: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 77: Mamba-2: 128 heads × 64 · state 128layer 77: no FFNlayer 78: GQA: 32 query / 2 KV heads · head 128layer 78: no FFNlayer 79: no mixerlayer 79: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 80: Mamba-2: 128 heads × 64 · state 128layer 80: no FFNlayer 81: no mixerlayer 81: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 82: Mamba-2: 128 heads × 64 · state 128layer 82: no FFNlayer 83: no mixerlayer 83: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 84: Mamba-2: 128 heads × 64 · state 128layer 84: no FFNlayer 85: no mixerlayer 85: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024layer 86: Mamba-2: 128 heads × 64 · state 128layer 86: no FFNlayer 87: no mixerlayer 87: MoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 102404487× 40normMamba-2: 128 heads × 64 · state 128+× 40normMoE: 512 experts, 22 active · expert 2688 · 1 shared · latent 1024+× 8normGQA: 32 query / 2 KV heads · head 128+Mamba-2full attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)121B
Active per token (modelled)12.8B
Without embeddings and output head120B total, 11.7B active
Multi-token-prediction layers (extra)2.94B
Published weights (Hugging Face count)124B
KV cache per token, BF16 (layers that grow with context)8 KiB
KV cache + state at 1M tokens, BF168.08 GiB
Decode FLOPs per token at 4K context25.3 GFLOP
Prefill FLOPs for a 4K prompt97.9 TFLOP

KV cache against context

Nemotron 3 Super: KV cache bytes against context length101001,00010,000100,0001,000,00095 MiB950 MiBcontext (tokens)KV cache + state (BF16)Nemotron 3 Super

Compare with other models →

Every architecture field

FieldValueSource
d_model4,096config.jsonconfig.jsonhidden_size
vocab131,072config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads32config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads2config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.mamba.typemamba2codemodelling codeMamba-2 mixer
mixers.mamba.heads128config.jsonconfig.jsonmamba_num_heads
mixers.mamba.head_dim64config.jsonconfig.jsonmamba_head_dim
mixers.mamba.state128config.jsonconfig.jsonssm_state_size
mixers.mamba.groups8config.jsonconfig.jsonn_groups
mixers.mamba.conv_kernel4config.jsonconfig.jsonconv_kernel
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts512config.jsonconfig.jsonn_routed_experts
ffns.moe.active22config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert2,688config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedfalsecodemodelling codeexperts are two-matrix MLPs
ffns.moe.shared1config.jsonconfig.jsonn_shared_experts
ffns.moe.d_shared5,376config.jsonconfig.jsonmoe_shared_expert_intermediate_size
ffns.moe.latent1,024config.jsonconfig.jsonmoe_latent_size
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff2,688config.jsonconfig.jsonintermediate_size
ffns.dense.gatedfalsecodemodelling codeMLP: two matrices, no gate
layout1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moeconfig.jsonconfig.jsonhybrid_override_pattern
norms_per_layer1codemodelling codetransformers 5.18.0 nemotron_h: one pre-norm per block (each block is a mixer or an MLP)
mtp_layers1config.jsonconfig.jsonnum_nextn_predict_layers
mtp_layer{"mixer":"full","ffn":"moe","n":1}codemodelling codeMTP: attention + MoE blocks

Sources

Listed in the LLM Architecture Gallery checklist as “Nemotron 3 Super (120B-A12B)” (name only; see about).