llm-architectures-explained

/models

Qwen3.5 397B-A17B

Alibaba Cloud (Qwen) · Qwen3.5 · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2026-02config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters397Blabmodel cardREADME: 397B in total and 17B activated
Active parameters17Blabmodel cardREADME: 17B activated
Context length256K tokenslabmodel cardREADME: 262,144 natively
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_5_moe_text: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_5_moe_text: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normyescodemodelling codetransformers 5.18.0 qwen3_5_moe: q_norm and k_norm
Positional encodingmultimodal RoPE on 25% of each headconfig.jsonconfig.jsontext_config.rope_parameters.partial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_5_moe_text: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

45× Gated DeltaNet + 15× GQA 32q/2kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Qwen3.5 397B-A17B: layer stack and blockslayers (60)mixer / FFNlayer 0: Gated DeltaNet: 64 heads · state 128×128 per headlayer 0: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 1: Gated DeltaNet: 64 heads · state 128×128 per headlayer 1: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 2: Gated DeltaNet: 64 heads · state 128×128 per headlayer 2: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 3: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 3: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 4: Gated DeltaNet: 64 heads · state 128×128 per headlayer 4: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 5: Gated DeltaNet: 64 heads · state 128×128 per headlayer 5: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 6: Gated DeltaNet: 64 heads · state 128×128 per headlayer 6: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 7: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 7: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 8: Gated DeltaNet: 64 heads · state 128×128 per headlayer 8: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 9: Gated DeltaNet: 64 heads · state 128×128 per headlayer 9: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 10: Gated DeltaNet: 64 heads · state 128×128 per headlayer 10: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 11: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 11: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 12: Gated DeltaNet: 64 heads · state 128×128 per headlayer 12: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 13: Gated DeltaNet: 64 heads · state 128×128 per headlayer 13: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 14: Gated DeltaNet: 64 heads · state 128×128 per headlayer 14: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 15: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 15: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 16: Gated DeltaNet: 64 heads · state 128×128 per headlayer 16: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 17: Gated DeltaNet: 64 heads · state 128×128 per headlayer 17: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 18: Gated DeltaNet: 64 heads · state 128×128 per headlayer 18: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 19: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 19: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 20: Gated DeltaNet: 64 heads · state 128×128 per headlayer 20: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 21: Gated DeltaNet: 64 heads · state 128×128 per headlayer 21: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 22: Gated DeltaNet: 64 heads · state 128×128 per headlayer 22: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 23: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 23: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 24: Gated DeltaNet: 64 heads · state 128×128 per headlayer 24: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 25: Gated DeltaNet: 64 heads · state 128×128 per headlayer 25: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 26: Gated DeltaNet: 64 heads · state 128×128 per headlayer 26: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 27: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 27: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 28: Gated DeltaNet: 64 heads · state 128×128 per headlayer 28: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 29: Gated DeltaNet: 64 heads · state 128×128 per headlayer 29: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 30: Gated DeltaNet: 64 heads · state 128×128 per headlayer 30: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 31: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 31: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 32: Gated DeltaNet: 64 heads · state 128×128 per headlayer 32: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 33: Gated DeltaNet: 64 heads · state 128×128 per headlayer 33: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 34: Gated DeltaNet: 64 heads · state 128×128 per headlayer 34: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 35: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 35: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 36: Gated DeltaNet: 64 heads · state 128×128 per headlayer 36: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 37: Gated DeltaNet: 64 heads · state 128×128 per headlayer 37: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 38: Gated DeltaNet: 64 heads · state 128×128 per headlayer 38: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 39: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 39: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 40: Gated DeltaNet: 64 heads · state 128×128 per headlayer 40: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 41: Gated DeltaNet: 64 heads · state 128×128 per headlayer 41: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 42: Gated DeltaNet: 64 heads · state 128×128 per headlayer 42: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 43: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 43: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 44: Gated DeltaNet: 64 heads · state 128×128 per headlayer 44: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 45: Gated DeltaNet: 64 heads · state 128×128 per headlayer 45: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 46: Gated DeltaNet: 64 heads · state 128×128 per headlayer 46: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 47: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 47: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 48: Gated DeltaNet: 64 heads · state 128×128 per headlayer 48: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 49: Gated DeltaNet: 64 heads · state 128×128 per headlayer 49: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 50: Gated DeltaNet: 64 heads · state 128×128 per headlayer 50: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 51: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 51: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 52: Gated DeltaNet: 64 heads · state 128×128 per headlayer 52: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 53: Gated DeltaNet: 64 heads · state 128×128 per headlayer 53: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 54: Gated DeltaNet: 64 heads · state 128×128 per headlayer 54: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 55: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 55: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 56: Gated DeltaNet: 64 heads · state 128×128 per headlayer 56: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 57: Gated DeltaNet: 64 heads · state 128×128 per headlayer 57: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 58: Gated DeltaNet: 64 heads · state 128×128 per headlayer 58: MoE: 512 experts, 10 active · expert 1024 · 1 sharedlayer 59: GQA: 32 query / 2 KV heads · head 256 · elementwise output gatelayer 59: MoE: 512 experts, 10 active · expert 1024 · 1 shared03059× 45normGated DeltaNet: 64 heads · state 128×128 per head+normMoE: 512 experts, 10 active · expert 1024 · 1 shared+× 15normGQA: 32 query / 2 KV heads · head 256 · elementwise output gate+normMoE: 512 experts, 10 active · expert 1024 · 1 shared+Gated DeltaNetfull attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)396B
Active per token (modelled)17.3B
Without embeddings and output head394B total, 15.3B active
Multi-token-prediction layers (extra)6.6B
Published weights (Hugging Face count)403B
KV cache per token, BF16 (layers that grow with context)30 KiB
KV cache + state at 256K tokens, BF167.59 GiB
Decode FLOPs per token at 4K context35 GFLOP
Prefill FLOPs for a 4K prompt131 TFLOP

KV cache against context

Qwen3.5 397B-A17B: KV cache bytes against context length101001,00010,000100,00095 MiB950 MiBcontext (tokens)KV cache + state (BF16)Qwen3.5 397B-A17B

Compare with other models →

Every architecture field

FieldValueSource
d_model4,096config.jsonconfig.jsontext_config.hidden_size
vocab248,320config.jsonconfig.jsontext_config.vocab_size
tied_embeddingsfalsecodemodelling codetransformers 5.18.0: PretrainedConfig.tie_word_embeddings defaultnot in config
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads32config.jsonconfig.jsontext_config.num_attention_heads
mixers.full.kv_heads2config.jsonconfig.jsontext_config.num_key_value_heads
mixers.full.head_dim256config.jsonconfig.jsontext_config.head_dim
mixers.full.gateelementwisecodemodelling codeattn_output_gate: q_proj also produces a sigmoid output gate
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 qwen3_5_moe_text: q_norm and k_norm
mixers.linear.typedeltanetcodemodelling codeGated DeltaNet linear attention
mixers.linear.k_heads16config.jsonconfig.jsontext_config.linear_num_key_heads
mixers.linear.v_heads64config.jsonconfig.jsontext_config.linear_num_value_heads
mixers.linear.k_head_dim128config.jsonconfig.jsontext_config.linear_key_head_dim
mixers.linear.v_head_dim128config.jsonconfig.jsontext_config.linear_value_head_dim
mixers.linear.conv_kernel4config.jsonconfig.jsontext_config.linear_conv_kernel_dim
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts512config.jsonconfig.jsontext_config.num_experts
ffns.moe.active10config.jsonconfig.jsontext_config.num_experts_per_tok
ffns.moe.d_expert1,024config.jsonconfig.jsontext_config.moe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1codemodelling codeone shared expert of shared_expert_intermediate_size
ffns.moe.d_shared1,024config.jsonconfig.jsontext_config.shared_expert_intermediate_size
layout3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moeconfig.jsonconfig.jsontext_config.layer_types
mtp_layers1config.jsonconfig.jsontext_config.mtp_num_hidden_layers
mtp_layer{"mixer":"full","ffn":"moe","n":1}codemodelling codeMTP layer: a full-attention block

Sources

Listed in the LLM Architecture Gallery checklist as “Qwen3.5 (397B)” (name only; see about).