llm-architectures-explained

/models

GLM-5.3-Flash

Z.ai · GLM-5 · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2026-08config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parameters320Blabmodel cardREADME: 320B total parameters and just 18B active
Active parameters18Blabmodel cardREADME: 18B active
Context length1M tokensconfig.jsonconfig.jsontext_config.max_position_embeddings
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for glm5_next_text: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for glm5_next_text: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block (MLA normalises its latent vectors, which is not QK-norm)
Positional encodingRoPE on 0% of each head; MLA layers use no RoPE; the linear-attention layers carry orderconfig.jsonconfig.jsontext_config.mla_use_nope
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for glm5_next_text: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

34× Kimi Delta Attention + 11× MLA 64h, latent 512, top-2048. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

GLM-5.3-Flash: layer stack and blockslayers (45)mixer / FFNlayer 0: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 0: Gated MLP: 12288layer 1: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 1: Gated MLP: 12288layer 2: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 2: Gated MLP: 12288layer 3: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 3: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 4: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 4: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 5: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 5: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 6: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 6: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 7: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 7: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 8: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 8: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 9: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 9: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 10: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 10: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 11: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 11: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 12: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 12: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 13: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 13: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 14: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 14: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 15: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 15: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 16: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 16: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 17: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 17: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 18: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 18: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 19: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 19: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 20: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 20: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 21: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 21: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 22: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 22: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 23: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 23: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 24: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 24: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 25: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 25: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 26: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 26: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 27: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 27: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 28: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 28: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 29: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 29: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 30: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 30: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 31: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 31: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 32: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 32: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 33: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 33: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 34: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 34: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 35: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 35: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 36: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 36: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 37: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 37: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 38: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 38: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 39: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 39: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 40: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 40: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 41: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 41: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 42: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 42: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 43: MLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048layer 43: MoE: 288 experts, 8 active · expert 2048 · 1 sharedlayer 44: Kimi Delta Attention: 64 heads · state 128×128 per headlayer 44: MoE: 288 experts, 8 active · expert 2048 · 1 shared02244× 31normKimi Delta Attention: 64 heads · state 128×128 per head+normMoE: 288 experts, 8 active · expert 2048 · 1 shared+× 11normMLA: 64 heads · KV latent 512 + RoPE 0 · Q latent 1536 · sparse top-2048+normMoE: 288 experts, 8 active · expert 2048 · 1 shared+× 3normKimi Delta Attention: 64 heads · state 128×128 per head+normGated MLP: 12288+Kimi Delta AttentionMLAdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)314B
Active per token (modelled)18.5B
Without embeddings and output head313B total, 17.2B active
Multi-token-prediction layers (extra)7.48B
Published weights (Hugging Face count)321B
KV cache per token, BF16 (layers that grow with context)13.8 KiB
KV cache + state at 1M tokens, BF1613.8 GiB
Decode FLOPs per token at 4K context37.7 GFLOP
Prefill FLOPs for a 4K prompt147 TFLOP

KV cache against context

GLM-5.3-Flash: KV cache bytes against context length101001,00010,000100,0001,000,00095 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)GLM-5.3-Flash

Compare with other models →

Every architecture field

FieldValueSource
d_model4,096config.jsonconfig.jsontext_config.hidden_size
vocab154,880config.jsonconfig.jsontext_config.vocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontext_config.tie_word_embeddings
mixers.mla.typemlacodemodelling codemulti-head latent attention
mixers.mla.heads64config.jsonconfig.jsontext_config.num_attention_heads
mixers.mla.q_lora_rank1,536config.jsonconfig.jsontext_config.q_lora_rank
mixers.mla.kv_lora_rank512config.jsonconfig.jsontext_config.kv_lora_rank
mixers.mla.qk_nope256config.jsonconfig.jsontext_config.qk_nope_head_dim
mixers.mla.qk_rope0config.jsonconfig.jsontext_config.qk_rope_head_dim
mixers.mla.v_head_dim256config.jsonconfig.jsontext_config.v_head_dim
mixers.mla.indexer.heads32config.jsonconfig.jsontext_config.index_n_heads
mixers.mla.indexer.head_dim128config.jsonconfig.jsontext_config.index_head_dim
mixers.mla.indexer.topk2,048config.jsonconfig.jsontext_config.index_topk
mixers.kda.typekdacodemodelling codeKimi Delta Attention
mixers.kda.k_heads64config.jsonconfig.jsontext_config.linear_attn_config.num_heads
mixers.kda.v_heads64config.jsonconfig.jsontext_config.linear_attn_config.num_heads
mixers.kda.k_head_dim128config.jsonconfig.jsontext_config.linear_attn_config.head_dim
mixers.kda.v_head_dim128config.jsonconfig.jsontext_config.linear_attn_config.head_dim
mixers.kda.conv_kernel4config.jsonconfig.jsontext_config.linear_attn_config.short_conv_kernel_size
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff12,288config.jsonconfig.jsontext_config.intermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts288config.jsonconfig.jsontext_config.n_routed_experts
ffns.moe.active8config.jsonconfig.jsontext_config.num_experts_per_tok
ffns.moe.d_expert2,048config.jsonconfig.jsontext_config.moe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1config.jsonconfig.jsontext_config.n_shared_experts
ffns.moe.d_shared2,048config.jsonconfig.jsontext_config.moe_intermediate_size
layout3× kda/dense · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 3× kda/moe · 1× mla/moe · 1× kda/moeconfig.jsonconfig.jsontext_config.layer_types, mlp_layer_types
mtp_layers1config.jsonconfig.jsontext_config.num_nextn_predict_layers

Sources

Listed in the LLM Architecture Gallery checklist as “GLM-5.3-Flash (320B)” (name only; see about).