llm-architectures-explained

/models

Qwen3.6 27B

Alibaba Cloud (Qwen) · Qwen3.5 · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2026-04config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters27Blabmodel cardREADME: Number of Parameters: 27B
Active parametersnot disclosednot disclosed
Context length256K tokenslabmodel cardREADME: 262,144 natively
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_5_text: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_5_text: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normyescodemodelling codetransformers 5.18.0 qwen3_5: q_norm and k_norm
Positional encodingmultimodal RoPE on 25% of each headconfig.jsonconfig.jsontext_config.rope_parameters.partial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for qwen3_5_text: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

48× Gated DeltaNet + 16× GQA 24q/4kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Qwen3.6 27B: layer stack and blockslayers (64)mixer / FFNlayer 0: Gated DeltaNet: 48 heads · state 128×128 per headlayer 0: Gated MLP: 17408layer 1: Gated DeltaNet: 48 heads · state 128×128 per headlayer 1: Gated MLP: 17408layer 2: Gated DeltaNet: 48 heads · state 128×128 per headlayer 2: Gated MLP: 17408layer 3: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 3: Gated MLP: 17408layer 4: Gated DeltaNet: 48 heads · state 128×128 per headlayer 4: Gated MLP: 17408layer 5: Gated DeltaNet: 48 heads · state 128×128 per headlayer 5: Gated MLP: 17408layer 6: Gated DeltaNet: 48 heads · state 128×128 per headlayer 6: Gated MLP: 17408layer 7: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 7: Gated MLP: 17408layer 8: Gated DeltaNet: 48 heads · state 128×128 per headlayer 8: Gated MLP: 17408layer 9: Gated DeltaNet: 48 heads · state 128×128 per headlayer 9: Gated MLP: 17408layer 10: Gated DeltaNet: 48 heads · state 128×128 per headlayer 10: Gated MLP: 17408layer 11: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 11: Gated MLP: 17408layer 12: Gated DeltaNet: 48 heads · state 128×128 per headlayer 12: Gated MLP: 17408layer 13: Gated DeltaNet: 48 heads · state 128×128 per headlayer 13: Gated MLP: 17408layer 14: Gated DeltaNet: 48 heads · state 128×128 per headlayer 14: Gated MLP: 17408layer 15: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 15: Gated MLP: 17408layer 16: Gated DeltaNet: 48 heads · state 128×128 per headlayer 16: Gated MLP: 17408layer 17: Gated DeltaNet: 48 heads · state 128×128 per headlayer 17: Gated MLP: 17408layer 18: Gated DeltaNet: 48 heads · state 128×128 per headlayer 18: Gated MLP: 17408layer 19: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 19: Gated MLP: 17408layer 20: Gated DeltaNet: 48 heads · state 128×128 per headlayer 20: Gated MLP: 17408layer 21: Gated DeltaNet: 48 heads · state 128×128 per headlayer 21: Gated MLP: 17408layer 22: Gated DeltaNet: 48 heads · state 128×128 per headlayer 22: Gated MLP: 17408layer 23: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 23: Gated MLP: 17408layer 24: Gated DeltaNet: 48 heads · state 128×128 per headlayer 24: Gated MLP: 17408layer 25: Gated DeltaNet: 48 heads · state 128×128 per headlayer 25: Gated MLP: 17408layer 26: Gated DeltaNet: 48 heads · state 128×128 per headlayer 26: Gated MLP: 17408layer 27: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 27: Gated MLP: 17408layer 28: Gated DeltaNet: 48 heads · state 128×128 per headlayer 28: Gated MLP: 17408layer 29: Gated DeltaNet: 48 heads · state 128×128 per headlayer 29: Gated MLP: 17408layer 30: Gated DeltaNet: 48 heads · state 128×128 per headlayer 30: Gated MLP: 17408layer 31: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 31: Gated MLP: 17408layer 32: Gated DeltaNet: 48 heads · state 128×128 per headlayer 32: Gated MLP: 17408layer 33: Gated DeltaNet: 48 heads · state 128×128 per headlayer 33: Gated MLP: 17408layer 34: Gated DeltaNet: 48 heads · state 128×128 per headlayer 34: Gated MLP: 17408layer 35: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 35: Gated MLP: 17408layer 36: Gated DeltaNet: 48 heads · state 128×128 per headlayer 36: Gated MLP: 17408layer 37: Gated DeltaNet: 48 heads · state 128×128 per headlayer 37: Gated MLP: 17408layer 38: Gated DeltaNet: 48 heads · state 128×128 per headlayer 38: Gated MLP: 17408layer 39: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 39: Gated MLP: 17408layer 40: Gated DeltaNet: 48 heads · state 128×128 per headlayer 40: Gated MLP: 17408layer 41: Gated DeltaNet: 48 heads · state 128×128 per headlayer 41: Gated MLP: 17408layer 42: Gated DeltaNet: 48 heads · state 128×128 per headlayer 42: Gated MLP: 17408layer 43: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 43: Gated MLP: 17408layer 44: Gated DeltaNet: 48 heads · state 128×128 per headlayer 44: Gated MLP: 17408layer 45: Gated DeltaNet: 48 heads · state 128×128 per headlayer 45: Gated MLP: 17408layer 46: Gated DeltaNet: 48 heads · state 128×128 per headlayer 46: Gated MLP: 17408layer 47: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 47: Gated MLP: 17408layer 48: Gated DeltaNet: 48 heads · state 128×128 per headlayer 48: Gated MLP: 17408layer 49: Gated DeltaNet: 48 heads · state 128×128 per headlayer 49: Gated MLP: 17408layer 50: Gated DeltaNet: 48 heads · state 128×128 per headlayer 50: Gated MLP: 17408layer 51: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 51: Gated MLP: 17408layer 52: Gated DeltaNet: 48 heads · state 128×128 per headlayer 52: Gated MLP: 17408layer 53: Gated DeltaNet: 48 heads · state 128×128 per headlayer 53: Gated MLP: 17408layer 54: Gated DeltaNet: 48 heads · state 128×128 per headlayer 54: Gated MLP: 17408layer 55: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 55: Gated MLP: 17408layer 56: Gated DeltaNet: 48 heads · state 128×128 per headlayer 56: Gated MLP: 17408layer 57: Gated DeltaNet: 48 heads · state 128×128 per headlayer 57: Gated MLP: 17408layer 58: Gated DeltaNet: 48 heads · state 128×128 per headlayer 58: Gated MLP: 17408layer 59: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 59: Gated MLP: 17408layer 60: Gated DeltaNet: 48 heads · state 128×128 per headlayer 60: Gated MLP: 17408layer 61: Gated DeltaNet: 48 heads · state 128×128 per headlayer 61: Gated MLP: 17408layer 62: Gated DeltaNet: 48 heads · state 128×128 per headlayer 62: Gated MLP: 17408layer 63: GQA: 24 query / 4 KV heads · head 256 · elementwise output gatelayer 63: Gated MLP: 1740803263× 48normGated DeltaNet: 48 heads · state 128×128 per head+normGated MLP: 17408+× 16normGQA: 24 query / 4 KV heads · head 256 · elementwise output gate+normGated MLP: 17408+Gated DeltaNetfull attentiondense FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)26.9B
Active per token (modelled)26.9B
Without embeddings and output head24.4B total, 24.4B active
Multi-token-prediction layers (extra)425M
Published weights (Hugging Face count)27.8B
KV cache per token, BF16 (layers that grow with context)64 KiB
KV cache + state at 256K tokens, BF1616.1 GiB
Decode FLOPs per token at 4K context53.1 GFLOP
Prefill FLOPs for a 4K prompt204 TFLOP

KV cache against context

Qwen3.6 27B: KV cache bytes against context length101001,00010,000100,00095 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)Qwen3.6 27B

Compare with other models →

Every architecture field

FieldValueSource
d_model5,120config.jsonconfig.jsontext_config.hidden_size
vocab248,320config.jsonconfig.jsontext_config.vocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontext_config.tie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads24config.jsonconfig.jsontext_config.num_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsontext_config.num_key_value_heads
mixers.full.head_dim256config.jsonconfig.jsontext_config.head_dim
mixers.full.gateelementwisecodemodelling codeattn_output_gate: q_proj also produces a sigmoid output gate
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 qwen3_5_text: q_norm and k_norm
mixers.linear.typedeltanetcodemodelling codeGated DeltaNet linear attention
mixers.linear.k_heads16config.jsonconfig.jsontext_config.linear_num_key_heads
mixers.linear.v_heads48config.jsonconfig.jsontext_config.linear_num_value_heads
mixers.linear.k_head_dim128config.jsonconfig.jsontext_config.linear_key_head_dim
mixers.linear.v_head_dim128config.jsonconfig.jsontext_config.linear_value_head_dim
mixers.linear.conv_kernel4config.jsonconfig.jsontext_config.linear_conv_kernel_dim
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff17,408config.jsonconfig.jsontext_config.intermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
layout3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/dense · 3× linear/dense · 1× full/denseconfig.jsonconfig.jsontext_config.layer_types
mtp_layers1config.jsonconfig.jsontext_config.mtp_num_hidden_layers
mtp_layer{"mixer":"full","ffn":"dense","n":1}codemodelling codeMTP layer: a full-attention block

Sources

Listed in the LLM Architecture Gallery checklist as “Qwen3.6 (27B)” (name only; see about).