llm-architectures-explained

/models

Qwen3-Next 80B-A3B

Alibaba Cloud (Qwen) · Qwen3-Next · open weights

Facts and where they come from

Released2025-09config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters80Blabmodel cardREADME: 80B in total and 3B activated
Active parameters3Blabmodel cardREADME: 3B activated
Context length256K tokensconfig.jsonconfig.jsonmax_position_embeddings
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_next: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_next: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normyescodemodelling codetransformers 5.18.0 qwen3_next: q_norm and k_norm
Positional encodingRoPE on 25% of each headconfig.jsonconfig.jsonpartial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_next: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

36× Gated DeltaNet + 12× GQA 16q/2kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Qwen3-Next 80B-A3B: layer stack and blockslayers (48)mixer / FFNlayer 0: Gated DeltaNet: 32 heads · state 128×128 per headlayer 0: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 1: Gated DeltaNet: 32 heads · state 128×128 per headlayer 1: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 2: Gated DeltaNet: 32 heads · state 128×128 per headlayer 2: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 3: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 3: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 4: Gated DeltaNet: 32 heads · state 128×128 per headlayer 4: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 5: Gated DeltaNet: 32 heads · state 128×128 per headlayer 5: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 6: Gated DeltaNet: 32 heads · state 128×128 per headlayer 6: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 7: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 7: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 8: Gated DeltaNet: 32 heads · state 128×128 per headlayer 8: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 9: Gated DeltaNet: 32 heads · state 128×128 per headlayer 9: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 10: Gated DeltaNet: 32 heads · state 128×128 per headlayer 10: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 11: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 11: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 12: Gated DeltaNet: 32 heads · state 128×128 per headlayer 12: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 13: Gated DeltaNet: 32 heads · state 128×128 per headlayer 13: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 14: Gated DeltaNet: 32 heads · state 128×128 per headlayer 14: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 15: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 15: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 16: Gated DeltaNet: 32 heads · state 128×128 per headlayer 16: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 17: Gated DeltaNet: 32 heads · state 128×128 per headlayer 17: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 18: Gated DeltaNet: 32 heads · state 128×128 per headlayer 18: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 19: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 19: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 20: Gated DeltaNet: 32 heads · state 128×128 per headlayer 20: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 21: Gated DeltaNet: 32 heads · state 128×128 per headlayer 21: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 22: Gated DeltaNet: 32 heads · state 128×128 per headlayer 22: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 23: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 23: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 24: Gated DeltaNet: 32 heads · state 128×128 per headlayer 24: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 25: Gated DeltaNet: 32 heads · state 128×128 per headlayer 25: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 26: Gated DeltaNet: 32 heads · state 128×128 per headlayer 26: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 27: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 27: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 28: Gated DeltaNet: 32 heads · state 128×128 per headlayer 28: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 29: Gated DeltaNet: 32 heads · state 128×128 per headlayer 29: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 30: Gated DeltaNet: 32 heads · state 128×128 per headlayer 30: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 31: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 31: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 32: Gated DeltaNet: 32 heads · state 128×128 per headlayer 32: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 33: Gated DeltaNet: 32 heads · state 128×128 per headlayer 33: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 34: Gated DeltaNet: 32 heads · state 128×128 per headlayer 34: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 35: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 35: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 36: Gated DeltaNet: 32 heads · state 128×128 per headlayer 36: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 37: Gated DeltaNet: 32 heads · state 128×128 per headlayer 37: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 38: Gated DeltaNet: 32 heads · state 128×128 per headlayer 38: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 39: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 39: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 40: Gated DeltaNet: 32 heads · state 128×128 per headlayer 40: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 41: Gated DeltaNet: 32 heads · state 128×128 per headlayer 41: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 42: Gated DeltaNet: 32 heads · state 128×128 per headlayer 42: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 43: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 43: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 44: Gated DeltaNet: 32 heads · state 128×128 per headlayer 44: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 45: Gated DeltaNet: 32 heads · state 128×128 per headlayer 45: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 46: Gated DeltaNet: 32 heads · state 128×128 per headlayer 46: MoE: 512 experts, 10 active · expert 512 · 1 sharedlayer 47: GQA: 16 query / 2 KV heads · head 256 · elementwise output gatelayer 47: MoE: 512 experts, 10 active · expert 512 · 1 shared02447× 36normGated DeltaNet: 32 heads · state 128×128 per head+normMoE: 512 experts, 10 active · expert 512 · 1 shared+× 12normGQA: 16 query / 2 KV heads · head 256 · elementwise output gate+normMoE: 512 experts, 10 active · expert 512 · 1 shared+Gated DeltaNetfull attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)79.7B
Active per token (modelled)3.87B
Without embeddings and output head79.1B total, 3.25B active
Multi-token-prediction layers (extra)1.65B
Published weights (Hugging Face count)81.3B
KV cache per token, BF16 (layers that grow with context)24 KiB
KV cache + state at 256K tokens, BF166.04 GiB
Decode FLOPs per token at 4K context8.05 GFLOP
Prefill FLOPs for a 4K prompt28.8 TFLOP

KV cache against context

Qwen3-Next 80B-A3B: KV cache bytes against context length101001,00010,000100,00095 MiB950 MiBcontext (tokens)KV cache + state (BF16)Qwen3-Next 80B-A3B

Compare with other models →

Every architecture field

FieldValueSource
d_model2,048config.jsonconfig.jsonhidden_size
vocab151,936config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads16config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads2config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim256config.jsonconfig.jsonhead_dim
mixers.full.gateelementwisecodemodelling codeattn_output_gate: q_proj also produces a sigmoid output gate
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 qwen3_next: q_norm and k_norm
mixers.linear.typedeltanetcodemodelling codeGated DeltaNet linear attention
mixers.linear.k_heads16config.jsonconfig.jsonlinear_num_key_heads
mixers.linear.v_heads32config.jsonconfig.jsonlinear_num_value_heads
mixers.linear.k_head_dim128config.jsonconfig.jsonlinear_key_head_dim
mixers.linear.v_head_dim128config.jsonconfig.jsonlinear_value_head_dim
mixers.linear.conv_kernel4config.jsonconfig.jsonlinear_conv_kernel_dim
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts512config.jsonconfig.jsonnum_experts
ffns.moe.active10config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert512config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1codemodelling codeone shared expert of shared_expert_intermediate_size
ffns.moe.d_shared512config.jsonconfig.jsonshared_expert_intermediate_size
layout3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moeconfig.jsonconfig.jsonfull_attention_interval
mtp_layers1labmodel cardREADME: Multi-Token Prediction (MTP); one MTP layer (the weights hold mtp.layers.0)

Sources

Listed in the LLM Architecture Gallery checklist as “Qwen3 Next (80B-A3B)” (name only; see about).