llm-architectures-explained

/models

GLM-4.7

Z.ai · GLM-4.5 · open weights

Facts and where they come from

Released2025-12config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parametersnot disclosednot disclosed
Active parametersnot disclosednot disclosed
Context length198K tokensconfig.jsonconfig.jsonmax_position_embeddings
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for glm4_moe: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for glm4_moe: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normyesconfig.jsonconfig.jsonuse_qk_norm
Positional encodingRoPE on 50% of each headconfig.jsonconfig.jsonpartial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for glm4_moe: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

GQA 96q/8kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

GLM-4.7: layer stack and blockslayers (92)mixer / FFNlayer 0: GQA: 96 query / 8 KV heads · head 128layer 0: Gated MLP: 12288layer 1: GQA: 96 query / 8 KV heads · head 128layer 1: Gated MLP: 12288layer 2: GQA: 96 query / 8 KV heads · head 128layer 2: Gated MLP: 12288layer 3: GQA: 96 query / 8 KV heads · head 128layer 3: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 4: GQA: 96 query / 8 KV heads · head 128layer 4: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 5: GQA: 96 query / 8 KV heads · head 128layer 5: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 6: GQA: 96 query / 8 KV heads · head 128layer 6: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 7: GQA: 96 query / 8 KV heads · head 128layer 7: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 8: GQA: 96 query / 8 KV heads · head 128layer 8: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 9: GQA: 96 query / 8 KV heads · head 128layer 9: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 10: GQA: 96 query / 8 KV heads · head 128layer 10: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 11: GQA: 96 query / 8 KV heads · head 128layer 11: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 12: GQA: 96 query / 8 KV heads · head 128layer 12: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 13: GQA: 96 query / 8 KV heads · head 128layer 13: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 14: GQA: 96 query / 8 KV heads · head 128layer 14: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 15: GQA: 96 query / 8 KV heads · head 128layer 15: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 16: GQA: 96 query / 8 KV heads · head 128layer 16: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 17: GQA: 96 query / 8 KV heads · head 128layer 17: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 18: GQA: 96 query / 8 KV heads · head 128layer 18: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 19: GQA: 96 query / 8 KV heads · head 128layer 19: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 20: GQA: 96 query / 8 KV heads · head 128layer 20: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 21: GQA: 96 query / 8 KV heads · head 128layer 21: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 22: GQA: 96 query / 8 KV heads · head 128layer 22: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 23: GQA: 96 query / 8 KV heads · head 128layer 23: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 24: GQA: 96 query / 8 KV heads · head 128layer 24: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 25: GQA: 96 query / 8 KV heads · head 128layer 25: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 26: GQA: 96 query / 8 KV heads · head 128layer 26: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 27: GQA: 96 query / 8 KV heads · head 128layer 27: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 28: GQA: 96 query / 8 KV heads · head 128layer 28: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 29: GQA: 96 query / 8 KV heads · head 128layer 29: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 30: GQA: 96 query / 8 KV heads · head 128layer 30: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 31: GQA: 96 query / 8 KV heads · head 128layer 31: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 32: GQA: 96 query / 8 KV heads · head 128layer 32: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 33: GQA: 96 query / 8 KV heads · head 128layer 33: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 34: GQA: 96 query / 8 KV heads · head 128layer 34: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 35: GQA: 96 query / 8 KV heads · head 128layer 35: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 36: GQA: 96 query / 8 KV heads · head 128layer 36: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 37: GQA: 96 query / 8 KV heads · head 128layer 37: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 38: GQA: 96 query / 8 KV heads · head 128layer 38: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 39: GQA: 96 query / 8 KV heads · head 128layer 39: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 40: GQA: 96 query / 8 KV heads · head 128layer 40: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 41: GQA: 96 query / 8 KV heads · head 128layer 41: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 42: GQA: 96 query / 8 KV heads · head 128layer 42: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 43: GQA: 96 query / 8 KV heads · head 128layer 43: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 44: GQA: 96 query / 8 KV heads · head 128layer 44: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 45: GQA: 96 query / 8 KV heads · head 128layer 45: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 46: GQA: 96 query / 8 KV heads · head 128layer 46: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 47: GQA: 96 query / 8 KV heads · head 128layer 47: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 48: GQA: 96 query / 8 KV heads · head 128layer 48: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 49: GQA: 96 query / 8 KV heads · head 128layer 49: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 50: GQA: 96 query / 8 KV heads · head 128layer 50: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 51: GQA: 96 query / 8 KV heads · head 128layer 51: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 52: GQA: 96 query / 8 KV heads · head 128layer 52: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 53: GQA: 96 query / 8 KV heads · head 128layer 53: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 54: GQA: 96 query / 8 KV heads · head 128layer 54: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 55: GQA: 96 query / 8 KV heads · head 128layer 55: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 56: GQA: 96 query / 8 KV heads · head 128layer 56: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 57: GQA: 96 query / 8 KV heads · head 128layer 57: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 58: GQA: 96 query / 8 KV heads · head 128layer 58: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 59: GQA: 96 query / 8 KV heads · head 128layer 59: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 60: GQA: 96 query / 8 KV heads · head 128layer 60: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 61: GQA: 96 query / 8 KV heads · head 128layer 61: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 62: GQA: 96 query / 8 KV heads · head 128layer 62: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 63: GQA: 96 query / 8 KV heads · head 128layer 63: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 64: GQA: 96 query / 8 KV heads · head 128layer 64: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 65: GQA: 96 query / 8 KV heads · head 128layer 65: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 66: GQA: 96 query / 8 KV heads · head 128layer 66: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 67: GQA: 96 query / 8 KV heads · head 128layer 67: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 68: GQA: 96 query / 8 KV heads · head 128layer 68: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 69: GQA: 96 query / 8 KV heads · head 128layer 69: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 70: GQA: 96 query / 8 KV heads · head 128layer 70: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 71: GQA: 96 query / 8 KV heads · head 128layer 71: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 72: GQA: 96 query / 8 KV heads · head 128layer 72: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 73: GQA: 96 query / 8 KV heads · head 128layer 73: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 74: GQA: 96 query / 8 KV heads · head 128layer 74: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 75: GQA: 96 query / 8 KV heads · head 128layer 75: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 76: GQA: 96 query / 8 KV heads · head 128layer 76: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 77: GQA: 96 query / 8 KV heads · head 128layer 77: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 78: GQA: 96 query / 8 KV heads · head 128layer 78: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 79: GQA: 96 query / 8 KV heads · head 128layer 79: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 80: GQA: 96 query / 8 KV heads · head 128layer 80: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 81: GQA: 96 query / 8 KV heads · head 128layer 81: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 82: GQA: 96 query / 8 KV heads · head 128layer 82: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 83: GQA: 96 query / 8 KV heads · head 128layer 83: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 84: GQA: 96 query / 8 KV heads · head 128layer 84: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 85: GQA: 96 query / 8 KV heads · head 128layer 85: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 86: GQA: 96 query / 8 KV heads · head 128layer 86: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 87: GQA: 96 query / 8 KV heads · head 128layer 87: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 88: GQA: 96 query / 8 KV heads · head 128layer 88: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 89: GQA: 96 query / 8 KV heads · head 128layer 89: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 90: GQA: 96 query / 8 KV heads · head 128layer 90: MoE: 160 experts, 8 active · expert 1536 · 1 sharedlayer 91: GQA: 96 query / 8 KV heads · head 128layer 91: MoE: 160 experts, 8 active · expert 1536 · 1 shared04691× 89normGQA: 96 query / 8 KV heads · head 128+normMoE: 160 experts, 8 active · expert 1536 · 1 shared+× 3normGQA: 96 query / 8 KV heads · head 128+normGated MLP: 12288+full attentiondense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)353B
Active per token (modelled)33.6B
Without embeddings and output head351B total, 32.1B active
Multi-token-prediction layers (extra)3.99B
Published weights (Hugging Face count)358B
KV cache per token, BF16 (layers that grow with context)368 KiB
KV cache + state at 198K tokens, BF1671.2 GiB
Decode FLOPs per token at 4K context84.2 GFLOP
Prefill FLOPs for a 4K prompt301 TFLOP

KV cache against context

GLM-4.7: KV cache bytes against context length101001,00010,000100,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)GLM-4.7

Compare with other models →

Every architecture field

FieldValueSource
d_model5,120config.jsonconfig.jsonhidden_size
vocab151,552config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads96config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads8config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.full.biastruecodemodelling codeattention_bias: true
mixers.full.qk_normtrueconfig.jsonconfig.jsonuse_qk_norm
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff12,288config.jsonconfig.jsonintermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts160config.jsonconfig.jsonn_routed_experts
ffns.moe.active8config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert1,536config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1config.jsonconfig.jsonn_shared_experts
ffns.moe.d_shared1,536config.jsonconfig.jsonmoe_intermediate_size
layout3× full/dense · 89× full/moeconfig.jsonconfig.jsonnum_hidden_layers, first_k_dense_replace
mtp_layers1config.jsonconfig.jsonnum_nextn_predict_layers

Sources

Listed in the LLM Architecture Gallery checklist as “GLM-4.7 (355B)” (name only; see about).