llm-architectures-explained

/models

Qwen3 235B-A22B

Alibaba Cloud (Qwen) · Qwen3 · open weights

Facts and where they come from

Released2025-04config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters235Blabmodel cardREADME: 235B in total and 22B activated
Active parameters22Blabmodel cardREADME: 22B activated
Context length32K tokenslabmodel cardREADME: 32,768 natively
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_moe: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_moe: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normyescodemodelling codetransformers 5.18.0 qwen3_moe: q_norm and k_norm
Positional encodingRoPEcodemodelling coderotary on the full head (default)
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_moe: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

GQA 64q/4kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Qwen3 235B-A22B: layer stack and blockslayers (94)mixer / FFNlayer 0: GQA: 64 query / 4 KV heads · head 128layer 0: MoE: 128 experts, 8 active · expert 1536layer 1: GQA: 64 query / 4 KV heads · head 128layer 1: MoE: 128 experts, 8 active · expert 1536layer 2: GQA: 64 query / 4 KV heads · head 128layer 2: MoE: 128 experts, 8 active · expert 1536layer 3: GQA: 64 query / 4 KV heads · head 128layer 3: MoE: 128 experts, 8 active · expert 1536layer 4: GQA: 64 query / 4 KV heads · head 128layer 4: MoE: 128 experts, 8 active · expert 1536layer 5: GQA: 64 query / 4 KV heads · head 128layer 5: MoE: 128 experts, 8 active · expert 1536layer 6: GQA: 64 query / 4 KV heads · head 128layer 6: MoE: 128 experts, 8 active · expert 1536layer 7: GQA: 64 query / 4 KV heads · head 128layer 7: MoE: 128 experts, 8 active · expert 1536layer 8: GQA: 64 query / 4 KV heads · head 128layer 8: MoE: 128 experts, 8 active · expert 1536layer 9: GQA: 64 query / 4 KV heads · head 128layer 9: MoE: 128 experts, 8 active · expert 1536layer 10: GQA: 64 query / 4 KV heads · head 128layer 10: MoE: 128 experts, 8 active · expert 1536layer 11: GQA: 64 query / 4 KV heads · head 128layer 11: MoE: 128 experts, 8 active · expert 1536layer 12: GQA: 64 query / 4 KV heads · head 128layer 12: MoE: 128 experts, 8 active · expert 1536layer 13: GQA: 64 query / 4 KV heads · head 128layer 13: MoE: 128 experts, 8 active · expert 1536layer 14: GQA: 64 query / 4 KV heads · head 128layer 14: MoE: 128 experts, 8 active · expert 1536layer 15: GQA: 64 query / 4 KV heads · head 128layer 15: MoE: 128 experts, 8 active · expert 1536layer 16: GQA: 64 query / 4 KV heads · head 128layer 16: MoE: 128 experts, 8 active · expert 1536layer 17: GQA: 64 query / 4 KV heads · head 128layer 17: MoE: 128 experts, 8 active · expert 1536layer 18: GQA: 64 query / 4 KV heads · head 128layer 18: MoE: 128 experts, 8 active · expert 1536layer 19: GQA: 64 query / 4 KV heads · head 128layer 19: MoE: 128 experts, 8 active · expert 1536layer 20: GQA: 64 query / 4 KV heads · head 128layer 20: MoE: 128 experts, 8 active · expert 1536layer 21: GQA: 64 query / 4 KV heads · head 128layer 21: MoE: 128 experts, 8 active · expert 1536layer 22: GQA: 64 query / 4 KV heads · head 128layer 22: MoE: 128 experts, 8 active · expert 1536layer 23: GQA: 64 query / 4 KV heads · head 128layer 23: MoE: 128 experts, 8 active · expert 1536layer 24: GQA: 64 query / 4 KV heads · head 128layer 24: MoE: 128 experts, 8 active · expert 1536layer 25: GQA: 64 query / 4 KV heads · head 128layer 25: MoE: 128 experts, 8 active · expert 1536layer 26: GQA: 64 query / 4 KV heads · head 128layer 26: MoE: 128 experts, 8 active · expert 1536layer 27: GQA: 64 query / 4 KV heads · head 128layer 27: MoE: 128 experts, 8 active · expert 1536layer 28: GQA: 64 query / 4 KV heads · head 128layer 28: MoE: 128 experts, 8 active · expert 1536layer 29: GQA: 64 query / 4 KV heads · head 128layer 29: MoE: 128 experts, 8 active · expert 1536layer 30: GQA: 64 query / 4 KV heads · head 128layer 30: MoE: 128 experts, 8 active · expert 1536layer 31: GQA: 64 query / 4 KV heads · head 128layer 31: MoE: 128 experts, 8 active · expert 1536layer 32: GQA: 64 query / 4 KV heads · head 128layer 32: MoE: 128 experts, 8 active · expert 1536layer 33: GQA: 64 query / 4 KV heads · head 128layer 33: MoE: 128 experts, 8 active · expert 1536layer 34: GQA: 64 query / 4 KV heads · head 128layer 34: MoE: 128 experts, 8 active · expert 1536layer 35: GQA: 64 query / 4 KV heads · head 128layer 35: MoE: 128 experts, 8 active · expert 1536layer 36: GQA: 64 query / 4 KV heads · head 128layer 36: MoE: 128 experts, 8 active · expert 1536layer 37: GQA: 64 query / 4 KV heads · head 128layer 37: MoE: 128 experts, 8 active · expert 1536layer 38: GQA: 64 query / 4 KV heads · head 128layer 38: MoE: 128 experts, 8 active · expert 1536layer 39: GQA: 64 query / 4 KV heads · head 128layer 39: MoE: 128 experts, 8 active · expert 1536layer 40: GQA: 64 query / 4 KV heads · head 128layer 40: MoE: 128 experts, 8 active · expert 1536layer 41: GQA: 64 query / 4 KV heads · head 128layer 41: MoE: 128 experts, 8 active · expert 1536layer 42: GQA: 64 query / 4 KV heads · head 128layer 42: MoE: 128 experts, 8 active · expert 1536layer 43: GQA: 64 query / 4 KV heads · head 128layer 43: MoE: 128 experts, 8 active · expert 1536layer 44: GQA: 64 query / 4 KV heads · head 128layer 44: MoE: 128 experts, 8 active · expert 1536layer 45: GQA: 64 query / 4 KV heads · head 128layer 45: MoE: 128 experts, 8 active · expert 1536layer 46: GQA: 64 query / 4 KV heads · head 128layer 46: MoE: 128 experts, 8 active · expert 1536layer 47: GQA: 64 query / 4 KV heads · head 128layer 47: MoE: 128 experts, 8 active · expert 1536layer 48: GQA: 64 query / 4 KV heads · head 128layer 48: MoE: 128 experts, 8 active · expert 1536layer 49: GQA: 64 query / 4 KV heads · head 128layer 49: MoE: 128 experts, 8 active · expert 1536layer 50: GQA: 64 query / 4 KV heads · head 128layer 50: MoE: 128 experts, 8 active · expert 1536layer 51: GQA: 64 query / 4 KV heads · head 128layer 51: MoE: 128 experts, 8 active · expert 1536layer 52: GQA: 64 query / 4 KV heads · head 128layer 52: MoE: 128 experts, 8 active · expert 1536layer 53: GQA: 64 query / 4 KV heads · head 128layer 53: MoE: 128 experts, 8 active · expert 1536layer 54: GQA: 64 query / 4 KV heads · head 128layer 54: MoE: 128 experts, 8 active · expert 1536layer 55: GQA: 64 query / 4 KV heads · head 128layer 55: MoE: 128 experts, 8 active · expert 1536layer 56: GQA: 64 query / 4 KV heads · head 128layer 56: MoE: 128 experts, 8 active · expert 1536layer 57: GQA: 64 query / 4 KV heads · head 128layer 57: MoE: 128 experts, 8 active · expert 1536layer 58: GQA: 64 query / 4 KV heads · head 128layer 58: MoE: 128 experts, 8 active · expert 1536layer 59: GQA: 64 query / 4 KV heads · head 128layer 59: MoE: 128 experts, 8 active · expert 1536layer 60: GQA: 64 query / 4 KV heads · head 128layer 60: MoE: 128 experts, 8 active · expert 1536layer 61: GQA: 64 query / 4 KV heads · head 128layer 61: MoE: 128 experts, 8 active · expert 1536layer 62: GQA: 64 query / 4 KV heads · head 128layer 62: MoE: 128 experts, 8 active · expert 1536layer 63: GQA: 64 query / 4 KV heads · head 128layer 63: MoE: 128 experts, 8 active · expert 1536layer 64: GQA: 64 query / 4 KV heads · head 128layer 64: MoE: 128 experts, 8 active · expert 1536layer 65: GQA: 64 query / 4 KV heads · head 128layer 65: MoE: 128 experts, 8 active · expert 1536layer 66: GQA: 64 query / 4 KV heads · head 128layer 66: MoE: 128 experts, 8 active · expert 1536layer 67: GQA: 64 query / 4 KV heads · head 128layer 67: MoE: 128 experts, 8 active · expert 1536layer 68: GQA: 64 query / 4 KV heads · head 128layer 68: MoE: 128 experts, 8 active · expert 1536layer 69: GQA: 64 query / 4 KV heads · head 128layer 69: MoE: 128 experts, 8 active · expert 1536layer 70: GQA: 64 query / 4 KV heads · head 128layer 70: MoE: 128 experts, 8 active · expert 1536layer 71: GQA: 64 query / 4 KV heads · head 128layer 71: MoE: 128 experts, 8 active · expert 1536layer 72: GQA: 64 query / 4 KV heads · head 128layer 72: MoE: 128 experts, 8 active · expert 1536layer 73: GQA: 64 query / 4 KV heads · head 128layer 73: MoE: 128 experts, 8 active · expert 1536layer 74: GQA: 64 query / 4 KV heads · head 128layer 74: MoE: 128 experts, 8 active · expert 1536layer 75: GQA: 64 query / 4 KV heads · head 128layer 75: MoE: 128 experts, 8 active · expert 1536layer 76: GQA: 64 query / 4 KV heads · head 128layer 76: MoE: 128 experts, 8 active · expert 1536layer 77: GQA: 64 query / 4 KV heads · head 128layer 77: MoE: 128 experts, 8 active · expert 1536layer 78: GQA: 64 query / 4 KV heads · head 128layer 78: MoE: 128 experts, 8 active · expert 1536layer 79: GQA: 64 query / 4 KV heads · head 128layer 79: MoE: 128 experts, 8 active · expert 1536layer 80: GQA: 64 query / 4 KV heads · head 128layer 80: MoE: 128 experts, 8 active · expert 1536layer 81: GQA: 64 query / 4 KV heads · head 128layer 81: MoE: 128 experts, 8 active · expert 1536layer 82: GQA: 64 query / 4 KV heads · head 128layer 82: MoE: 128 experts, 8 active · expert 1536layer 83: GQA: 64 query / 4 KV heads · head 128layer 83: MoE: 128 experts, 8 active · expert 1536layer 84: GQA: 64 query / 4 KV heads · head 128layer 84: MoE: 128 experts, 8 active · expert 1536layer 85: GQA: 64 query / 4 KV heads · head 128layer 85: MoE: 128 experts, 8 active · expert 1536layer 86: GQA: 64 query / 4 KV heads · head 128layer 86: MoE: 128 experts, 8 active · expert 1536layer 87: GQA: 64 query / 4 KV heads · head 128layer 87: MoE: 128 experts, 8 active · expert 1536layer 88: GQA: 64 query / 4 KV heads · head 128layer 88: MoE: 128 experts, 8 active · expert 1536layer 89: GQA: 64 query / 4 KV heads · head 128layer 89: MoE: 128 experts, 8 active · expert 1536layer 90: GQA: 64 query / 4 KV heads · head 128layer 90: MoE: 128 experts, 8 active · expert 1536layer 91: GQA: 64 query / 4 KV heads · head 128layer 91: MoE: 128 experts, 8 active · expert 1536layer 92: GQA: 64 query / 4 KV heads · head 128layer 92: MoE: 128 experts, 8 active · expert 1536layer 93: GQA: 64 query / 4 KV heads · head 128layer 93: MoE: 128 experts, 8 active · expert 153604793× 94normGQA: 64 query / 4 KV heads · head 128+normMoE: 128 experts, 8 active · expert 1536+full attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)235B
Active per token (modelled)22.2B
Without embeddings and output head234B total, 20.9B active
Published weights (Hugging Face count)235B
KV cache per token, BF16 (layers that grow with context)188 KiB
KV cache + state at 32K tokens, BF165.88 GiB
Decode FLOPs per token at 4K context55.8 GFLOP
Prefill FLOPs for a 4K prompt197 TFLOP

KV cache against context

Qwen3 235B-A22B: KV cache bytes against context length101001,00010,000980 KiB9.5 MiB95 MiB950 MiBcontext (tokens)KV cache + state (BF16)Qwen3 235B-A22B

Compare with other models →

Every architecture field

FieldValueSource
d_model4,096config.jsonconfig.jsonhidden_size
vocab151,936config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads64config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 qwen3_moe: q_norm and k_norm
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts128config.jsonconfig.jsonnum_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert1,536config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout94× full/moeconfig.jsonconfig.jsonnum_hidden_layers

Sources

Listed in the LLM Architecture Gallery checklist as “Qwen3 (235B-A22B)” (name only; see about).