llm-architectures-explained

/models

GLaM (64B/64E)

Google · GLaM · closed weights

Facts and where they come from

Released2021-12paperpaperarXiv v1, December 2021
Licenceproprietarylabpaperweights not published
Total parameters1.2TpaperpaperTable 4: 64B/64E, 1.2T parameters
Active parameters96.6BpaperpaperTable 4: 96.6B activated
Context lengthnot disclosednot disclosed
Norm placementprecodemodelling codeGLaM paper: standard Transformer layers
Norm typeLayerNormcodemodelling codeGLaM paper: standard Transformer layers
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingrelative position biaspaperpaperGLaM §4: per-layer relative positional bias
Parallel attention and MLPnocodemodelling codeGLaM paper: standard Transformer layers

Architecture, drawn from the data

MHA 128q/128kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

GLaM (64B/64E): layer stack and blockslayers (64)mixer / FFNlayer 0: MHA: 128 query / 128 KV heads · head 128layer 0: Gated MLP: 32768layer 1: MHA: 128 query / 128 KV heads · head 128layer 1: MoE: 64 experts, 2 active · expert 32768layer 2: MHA: 128 query / 128 KV heads · head 128layer 2: Gated MLP: 32768layer 3: MHA: 128 query / 128 KV heads · head 128layer 3: MoE: 64 experts, 2 active · expert 32768layer 4: MHA: 128 query / 128 KV heads · head 128layer 4: Gated MLP: 32768layer 5: MHA: 128 query / 128 KV heads · head 128layer 5: MoE: 64 experts, 2 active · expert 32768layer 6: MHA: 128 query / 128 KV heads · head 128layer 6: Gated MLP: 32768layer 7: MHA: 128 query / 128 KV heads · head 128layer 7: MoE: 64 experts, 2 active · expert 32768layer 8: MHA: 128 query / 128 KV heads · head 128layer 8: Gated MLP: 32768layer 9: MHA: 128 query / 128 KV heads · head 128layer 9: MoE: 64 experts, 2 active · expert 32768layer 10: MHA: 128 query / 128 KV heads · head 128layer 10: Gated MLP: 32768layer 11: MHA: 128 query / 128 KV heads · head 128layer 11: MoE: 64 experts, 2 active · expert 32768layer 12: MHA: 128 query / 128 KV heads · head 128layer 12: Gated MLP: 32768layer 13: MHA: 128 query / 128 KV heads · head 128layer 13: MoE: 64 experts, 2 active · expert 32768layer 14: MHA: 128 query / 128 KV heads · head 128layer 14: Gated MLP: 32768layer 15: MHA: 128 query / 128 KV heads · head 128layer 15: MoE: 64 experts, 2 active · expert 32768layer 16: MHA: 128 query / 128 KV heads · head 128layer 16: Gated MLP: 32768layer 17: MHA: 128 query / 128 KV heads · head 128layer 17: MoE: 64 experts, 2 active · expert 32768layer 18: MHA: 128 query / 128 KV heads · head 128layer 18: Gated MLP: 32768layer 19: MHA: 128 query / 128 KV heads · head 128layer 19: MoE: 64 experts, 2 active · expert 32768layer 20: MHA: 128 query / 128 KV heads · head 128layer 20: Gated MLP: 32768layer 21: MHA: 128 query / 128 KV heads · head 128layer 21: MoE: 64 experts, 2 active · expert 32768layer 22: MHA: 128 query / 128 KV heads · head 128layer 22: Gated MLP: 32768layer 23: MHA: 128 query / 128 KV heads · head 128layer 23: MoE: 64 experts, 2 active · expert 32768layer 24: MHA: 128 query / 128 KV heads · head 128layer 24: Gated MLP: 32768layer 25: MHA: 128 query / 128 KV heads · head 128layer 25: MoE: 64 experts, 2 active · expert 32768layer 26: MHA: 128 query / 128 KV heads · head 128layer 26: Gated MLP: 32768layer 27: MHA: 128 query / 128 KV heads · head 128layer 27: MoE: 64 experts, 2 active · expert 32768layer 28: MHA: 128 query / 128 KV heads · head 128layer 28: Gated MLP: 32768layer 29: MHA: 128 query / 128 KV heads · head 128layer 29: MoE: 64 experts, 2 active · expert 32768layer 30: MHA: 128 query / 128 KV heads · head 128layer 30: Gated MLP: 32768layer 31: MHA: 128 query / 128 KV heads · head 128layer 31: MoE: 64 experts, 2 active · expert 32768layer 32: MHA: 128 query / 128 KV heads · head 128layer 32: Gated MLP: 32768layer 33: MHA: 128 query / 128 KV heads · head 128layer 33: MoE: 64 experts, 2 active · expert 32768layer 34: MHA: 128 query / 128 KV heads · head 128layer 34: Gated MLP: 32768layer 35: MHA: 128 query / 128 KV heads · head 128layer 35: MoE: 64 experts, 2 active · expert 32768layer 36: MHA: 128 query / 128 KV heads · head 128layer 36: Gated MLP: 32768layer 37: MHA: 128 query / 128 KV heads · head 128layer 37: MoE: 64 experts, 2 active · expert 32768layer 38: MHA: 128 query / 128 KV heads · head 128layer 38: Gated MLP: 32768layer 39: MHA: 128 query / 128 KV heads · head 128layer 39: MoE: 64 experts, 2 active · expert 32768layer 40: MHA: 128 query / 128 KV heads · head 128layer 40: Gated MLP: 32768layer 41: MHA: 128 query / 128 KV heads · head 128layer 41: MoE: 64 experts, 2 active · expert 32768layer 42: MHA: 128 query / 128 KV heads · head 128layer 42: Gated MLP: 32768layer 43: MHA: 128 query / 128 KV heads · head 128layer 43: MoE: 64 experts, 2 active · expert 32768layer 44: MHA: 128 query / 128 KV heads · head 128layer 44: Gated MLP: 32768layer 45: MHA: 128 query / 128 KV heads · head 128layer 45: MoE: 64 experts, 2 active · expert 32768layer 46: MHA: 128 query / 128 KV heads · head 128layer 46: Gated MLP: 32768layer 47: MHA: 128 query / 128 KV heads · head 128layer 47: MoE: 64 experts, 2 active · expert 32768layer 48: MHA: 128 query / 128 KV heads · head 128layer 48: Gated MLP: 32768layer 49: MHA: 128 query / 128 KV heads · head 128layer 49: MoE: 64 experts, 2 active · expert 32768layer 50: MHA: 128 query / 128 KV heads · head 128layer 50: Gated MLP: 32768layer 51: MHA: 128 query / 128 KV heads · head 128layer 51: MoE: 64 experts, 2 active · expert 32768layer 52: MHA: 128 query / 128 KV heads · head 128layer 52: Gated MLP: 32768layer 53: MHA: 128 query / 128 KV heads · head 128layer 53: MoE: 64 experts, 2 active · expert 32768layer 54: MHA: 128 query / 128 KV heads · head 128layer 54: Gated MLP: 32768layer 55: MHA: 128 query / 128 KV heads · head 128layer 55: MoE: 64 experts, 2 active · expert 32768layer 56: MHA: 128 query / 128 KV heads · head 128layer 56: Gated MLP: 32768layer 57: MHA: 128 query / 128 KV heads · head 128layer 57: MoE: 64 experts, 2 active · expert 32768layer 58: MHA: 128 query / 128 KV heads · head 128layer 58: Gated MLP: 32768layer 59: MHA: 128 query / 128 KV heads · head 128layer 59: MoE: 64 experts, 2 active · expert 32768layer 60: MHA: 128 query / 128 KV heads · head 128layer 60: Gated MLP: 32768layer 61: MHA: 128 query / 128 KV heads · head 128layer 61: MoE: 64 experts, 2 active · expert 32768layer 62: MHA: 128 query / 128 KV heads · head 128layer 62: Gated MLP: 32768layer 63: MHA: 128 query / 128 KV heads · head 128layer 63: MoE: 64 experts, 2 active · expert 3276803263× 32normMHA: 128 query / 128 KV heads · head 128+normGated MLP: 32768+× 32normMHA: 128 query / 128 KV heads · head 128+normMoE: 64 experts, 2 active · expert 32768+full attentiondense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)1.16T
Active per token (modelled)98.7B
Without embeddings and output head1.16T total, 94.5B active
KV cache per token, BF16 (layers that grow with context)4 MiB
KV cache + state at 128K tokens, BF16512 GiB
Decode FLOPs per token at 4K context210 GFLOP
Prefill FLOPs for a 4K prompt809 TFLOP

KV cache against context

GLaM (64B/64E): KV cache bytes against context length101001,00010,000100,0009.5 MiB95 MiB950 MiB9.3 GiB93 GiBcontext (tokens)KV cache + state (BF16)GLaM (64B/64E)

Compare with other models →

Every architecture field

FieldValueSource
d_model8,192paperpaperTable 4: d_model 8,192
vocab256,000paperpaper§5: vocabulary of size 256K (256,000 assumed)
tied_embeddingsfalsepaperpaperdata/transcribed/glam-64b-64e.json: tie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads128paperpaperTable 4: heads 128
mixers.full.kv_heads128paperpaperdata/transcribed/glam-64b-64e.json: num_key_value_heads
mixers.full.head_dim128paperpaperTable 4: d_head 128
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff32,768paperpaperTable 4: d_ffn 32,768
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts64paperpaperTable 4: 64 experts
ffns.moe.active2paperpaper§3: top-2 gating
ffns.moe.d_expert32,768paperpaperTable 4: d_ffn 32,768
ffns.moe.gatedfalsepaperpaper§4: GLU (with GELU) replaces the first projection in the non-MoE feed-forward sub-layers only; experts taken as two-matrix MLPs
layout1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moe · 1× full/dense · 1× full/moepaperpaperTable 4: L 64

Sources