llm-architectures-explained

/models

Nemotron 3 Ultra

NVIDIA · Nemotron 3 · open weights

Facts and where they come from

Released2026-06config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceotherconfig.jsonconfig.jsonREADME metadata: license
Total parameters550Blabmodel cardREADME: 550B Total / 55B Active
Active parameters55Blabmodel cardREADME: 55B Active
Context length1M tokenslabmodel cardREADME: up to 1M tokens
Norm placementprecodemodelling codetransformers 5.18.0 nemotron_h: one norm before each mixer or MLP block
Norm typeRMSNormcodemodelling codetransformers 5.18.0 nemotron_h: one norm before each mixer or MLP block
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPEconfig.jsonconfig.jsonpartial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 nemotron_h: one norm before each mixer or MLP block

Architecture, drawn from the data

48× Mamba-2 + 12× GQA 64q/2kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Nemotron 3 Ultra: layer stack and blockslayers (108)mixer / FFNlayer 0: Mamba-2: 256 heads × 64 · state 128layer 0: no FFNlayer 1: no mixerlayer 1: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 2: Mamba-2: 256 heads × 64 · state 128layer 2: no FFNlayer 3: no mixerlayer 3: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 4: Mamba-2: 256 heads × 64 · state 128layer 4: no FFNlayer 5: no mixerlayer 5: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 6: Mamba-2: 256 heads × 64 · state 128layer 6: no FFNlayer 7: GQA: 64 query / 2 KV heads · head 128layer 7: no FFNlayer 8: no mixerlayer 8: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 9: Mamba-2: 256 heads × 64 · state 128layer 9: no FFNlayer 10: no mixerlayer 10: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 11: Mamba-2: 256 heads × 64 · state 128layer 11: no FFNlayer 12: no mixerlayer 12: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 13: Mamba-2: 256 heads × 64 · state 128layer 13: no FFNlayer 14: GQA: 64 query / 2 KV heads · head 128layer 14: no FFNlayer 15: no mixerlayer 15: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 16: Mamba-2: 256 heads × 64 · state 128layer 16: no FFNlayer 17: no mixerlayer 17: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 18: Mamba-2: 256 heads × 64 · state 128layer 18: no FFNlayer 19: no mixerlayer 19: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 20: Mamba-2: 256 heads × 64 · state 128layer 20: no FFNlayer 21: no mixerlayer 21: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 22: Mamba-2: 256 heads × 64 · state 128layer 22: no FFNlayer 23: GQA: 64 query / 2 KV heads · head 128layer 23: no FFNlayer 24: no mixerlayer 24: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 25: Mamba-2: 256 heads × 64 · state 128layer 25: no FFNlayer 26: no mixerlayer 26: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 27: Mamba-2: 256 heads × 64 · state 128layer 27: no FFNlayer 28: no mixerlayer 28: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 29: Mamba-2: 256 heads × 64 · state 128layer 29: no FFNlayer 30: no mixerlayer 30: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 31: Mamba-2: 256 heads × 64 · state 128layer 31: no FFNlayer 32: GQA: 64 query / 2 KV heads · head 128layer 32: no FFNlayer 33: no mixerlayer 33: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 34: Mamba-2: 256 heads × 64 · state 128layer 34: no FFNlayer 35: no mixerlayer 35: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 36: Mamba-2: 256 heads × 64 · state 128layer 36: no FFNlayer 37: no mixerlayer 37: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 38: Mamba-2: 256 heads × 64 · state 128layer 38: no FFNlayer 39: GQA: 64 query / 2 KV heads · head 128layer 39: no FFNlayer 40: no mixerlayer 40: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 41: Mamba-2: 256 heads × 64 · state 128layer 41: no FFNlayer 42: no mixerlayer 42: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 43: Mamba-2: 256 heads × 64 · state 128layer 43: no FFNlayer 44: no mixerlayer 44: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 45: Mamba-2: 256 heads × 64 · state 128layer 45: no FFNlayer 46: no mixerlayer 46: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 47: Mamba-2: 256 heads × 64 · state 128layer 47: no FFNlayer 48: GQA: 64 query / 2 KV heads · head 128layer 48: no FFNlayer 49: no mixerlayer 49: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 50: Mamba-2: 256 heads × 64 · state 128layer 50: no FFNlayer 51: no mixerlayer 51: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 52: Mamba-2: 256 heads × 64 · state 128layer 52: no FFNlayer 53: no mixerlayer 53: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 54: Mamba-2: 256 heads × 64 · state 128layer 54: no FFNlayer 55: no mixerlayer 55: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 56: Mamba-2: 256 heads × 64 · state 128layer 56: no FFNlayer 57: GQA: 64 query / 2 KV heads · head 128layer 57: no FFNlayer 58: no mixerlayer 58: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 59: Mamba-2: 256 heads × 64 · state 128layer 59: no FFNlayer 60: no mixerlayer 60: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 61: Mamba-2: 256 heads × 64 · state 128layer 61: no FFNlayer 62: no mixerlayer 62: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 63: Mamba-2: 256 heads × 64 · state 128layer 63: no FFNlayer 64: GQA: 64 query / 2 KV heads · head 128layer 64: no FFNlayer 65: no mixerlayer 65: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 66: Mamba-2: 256 heads × 64 · state 128layer 66: no FFNlayer 67: no mixerlayer 67: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 68: Mamba-2: 256 heads × 64 · state 128layer 68: no FFNlayer 69: no mixerlayer 69: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 70: Mamba-2: 256 heads × 64 · state 128layer 70: no FFNlayer 71: no mixerlayer 71: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 72: Mamba-2: 256 heads × 64 · state 128layer 72: no FFNlayer 73: GQA: 64 query / 2 KV heads · head 128layer 73: no FFNlayer 74: no mixerlayer 74: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 75: Mamba-2: 256 heads × 64 · state 128layer 75: no FFNlayer 76: no mixerlayer 76: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 77: Mamba-2: 256 heads × 64 · state 128layer 77: no FFNlayer 78: no mixerlayer 78: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 79: Mamba-2: 256 heads × 64 · state 128layer 79: no FFNlayer 80: no mixerlayer 80: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 81: Mamba-2: 256 heads × 64 · state 128layer 81: no FFNlayer 82: GQA: 64 query / 2 KV heads · head 128layer 82: no FFNlayer 83: no mixerlayer 83: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 84: Mamba-2: 256 heads × 64 · state 128layer 84: no FFNlayer 85: no mixerlayer 85: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 86: Mamba-2: 256 heads × 64 · state 128layer 86: no FFNlayer 87: no mixerlayer 87: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 88: Mamba-2: 256 heads × 64 · state 128layer 88: no FFNlayer 89: GQA: 64 query / 2 KV heads · head 128layer 89: no FFNlayer 90: no mixerlayer 90: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 91: Mamba-2: 256 heads × 64 · state 128layer 91: no FFNlayer 92: no mixerlayer 92: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 93: Mamba-2: 256 heads × 64 · state 128layer 93: no FFNlayer 94: no mixerlayer 94: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 95: Mamba-2: 256 heads × 64 · state 128layer 95: no FFNlayer 96: no mixerlayer 96: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 97: Mamba-2: 256 heads × 64 · state 128layer 97: no FFNlayer 98: GQA: 64 query / 2 KV heads · head 128layer 98: no FFNlayer 99: no mixerlayer 99: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 100: Mamba-2: 256 heads × 64 · state 128layer 100: no FFNlayer 101: no mixerlayer 101: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 102: Mamba-2: 256 heads × 64 · state 128layer 102: no FFNlayer 103: no mixerlayer 103: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 104: Mamba-2: 256 heads × 64 · state 128layer 104: no FFNlayer 105: no mixerlayer 105: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048layer 106: Mamba-2: 256 heads × 64 · state 128layer 106: no FFNlayer 107: no mixerlayer 107: MoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048054107× 48normMamba-2: 256 heads × 64 · state 128+× 48normMoE: 512 experts, 22 active · expert 5120 · 1 shared · latent 2048+× 12normGQA: 64 query / 2 KV heads · head 128+Mamba-2full attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)549B
Active per token (modelled)56.1B
Without embeddings and output head547B total, 53.9B active
Multi-token-prediction layers (extra)11.2B
Published weights (Hugging Face count)303B (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)12 KiB
KV cache + state at 1M tokens, BF1612.2 GiB
Decode FLOPs per token at 4K context112 GFLOP
Prefill FLOPs for a 4K prompt447 TFLOP

KV cache against context

Nemotron 3 Ultra: KV cache bytes against context length101001,00010,000100,0001,000,000950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)Nemotron 3 Ultra

Compare with other models →

Every architecture field

FieldValueSource
d_model8,192config.jsonconfig.jsonhidden_size
vocab131,072config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads64config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads2config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.mamba.typemamba2codemodelling codeMamba-2 mixer
mixers.mamba.heads256config.jsonconfig.jsonmamba_num_heads
mixers.mamba.head_dim64config.jsonconfig.jsonmamba_head_dim
mixers.mamba.state128config.jsonconfig.jsonssm_state_size
mixers.mamba.groups8config.jsonconfig.jsonn_groups
mixers.mamba.conv_kernel4config.jsonconfig.jsonconv_kernel
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts512config.jsonconfig.jsonn_routed_experts
ffns.moe.active22config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert5,120config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedfalsecodemodelling codeexperts are two-matrix MLPs
ffns.moe.shared1config.jsonconfig.jsonn_shared_experts
ffns.moe.d_shared10,240config.jsonconfig.jsonmoe_shared_expert_intermediate_size
ffns.moe.latent2,048config.jsonconfig.jsonmoe_latent_size
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff5,120config.jsonconfig.jsonintermediate_size
ffns.dense.gatedfalsecodemodelling codeMLP: two matrices, no gate
layout1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× full/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moe · 1× mamba/none · 1× none/moeconfig.jsonconfig.jsonlayers_block_type
norms_per_layer1codemodelling codetransformers 5.18.0 nemotron_h: one pre-norm per block (each block is a mixer or an MLP)
mtp_layers1config.jsonconfig.jsonnum_nextn_predict_layers
mtp_layer{"mixer":"full","ffn":"moe","n":1}codemodelling codeMTP: attention + MoE blocks

Sources

Listed in the LLM Architecture Gallery checklist as “Nemotron 3 Ultra (550B-A55B)” (name only; see about).