llm-architectures-explained

/models

ZAYA1-8B

Zyphra · ZAYA · open weights

Facts and where they come from

Released2026-05config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters8.4Blabmodel cardREADME: 760M active parameters and 8.4B total parameters
Active parameters760Mlabmodel cardREADME: 760M active
Context length128K tokensconfig.jsonconfig.jsonmax_position_embeddings
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for zaya: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for zaya: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPE on 50% of each headconfig.jsonconfig.jsonpartial_rotary_factor
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for zaya: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

GQA 8q/2kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

ZAYA1-8B: layer stack and blockslayers (40)mixer / FFNlayer 0: GQA: 8 query / 2 KV heads · head 128layer 0: MoE: 16 experts, 1 active · expert 2048layer 1: GQA: 8 query / 2 KV heads · head 128layer 1: MoE: 16 experts, 1 active · expert 2048layer 2: GQA: 8 query / 2 KV heads · head 128layer 2: MoE: 16 experts, 1 active · expert 2048layer 3: GQA: 8 query / 2 KV heads · head 128layer 3: MoE: 16 experts, 1 active · expert 2048layer 4: GQA: 8 query / 2 KV heads · head 128layer 4: MoE: 16 experts, 1 active · expert 2048layer 5: GQA: 8 query / 2 KV heads · head 128layer 5: MoE: 16 experts, 1 active · expert 2048layer 6: GQA: 8 query / 2 KV heads · head 128layer 6: MoE: 16 experts, 1 active · expert 2048layer 7: GQA: 8 query / 2 KV heads · head 128layer 7: MoE: 16 experts, 1 active · expert 2048layer 8: GQA: 8 query / 2 KV heads · head 128layer 8: MoE: 16 experts, 1 active · expert 2048layer 9: GQA: 8 query / 2 KV heads · head 128layer 9: MoE: 16 experts, 1 active · expert 2048layer 10: GQA: 8 query / 2 KV heads · head 128layer 10: MoE: 16 experts, 1 active · expert 2048layer 11: GQA: 8 query / 2 KV heads · head 128layer 11: MoE: 16 experts, 1 active · expert 2048layer 12: GQA: 8 query / 2 KV heads · head 128layer 12: MoE: 16 experts, 1 active · expert 2048layer 13: GQA: 8 query / 2 KV heads · head 128layer 13: MoE: 16 experts, 1 active · expert 2048layer 14: GQA: 8 query / 2 KV heads · head 128layer 14: MoE: 16 experts, 1 active · expert 2048layer 15: GQA: 8 query / 2 KV heads · head 128layer 15: MoE: 16 experts, 1 active · expert 2048layer 16: GQA: 8 query / 2 KV heads · head 128layer 16: MoE: 16 experts, 1 active · expert 2048layer 17: GQA: 8 query / 2 KV heads · head 128layer 17: MoE: 16 experts, 1 active · expert 2048layer 18: GQA: 8 query / 2 KV heads · head 128layer 18: MoE: 16 experts, 1 active · expert 2048layer 19: GQA: 8 query / 2 KV heads · head 128layer 19: MoE: 16 experts, 1 active · expert 2048layer 20: GQA: 8 query / 2 KV heads · head 128layer 20: MoE: 16 experts, 1 active · expert 2048layer 21: GQA: 8 query / 2 KV heads · head 128layer 21: MoE: 16 experts, 1 active · expert 2048layer 22: GQA: 8 query / 2 KV heads · head 128layer 22: MoE: 16 experts, 1 active · expert 2048layer 23: GQA: 8 query / 2 KV heads · head 128layer 23: MoE: 16 experts, 1 active · expert 2048layer 24: GQA: 8 query / 2 KV heads · head 128layer 24: MoE: 16 experts, 1 active · expert 2048layer 25: GQA: 8 query / 2 KV heads · head 128layer 25: MoE: 16 experts, 1 active · expert 2048layer 26: GQA: 8 query / 2 KV heads · head 128layer 26: MoE: 16 experts, 1 active · expert 2048layer 27: GQA: 8 query / 2 KV heads · head 128layer 27: MoE: 16 experts, 1 active · expert 2048layer 28: GQA: 8 query / 2 KV heads · head 128layer 28: MoE: 16 experts, 1 active · expert 2048layer 29: GQA: 8 query / 2 KV heads · head 128layer 29: MoE: 16 experts, 1 active · expert 2048layer 30: GQA: 8 query / 2 KV heads · head 128layer 30: MoE: 16 experts, 1 active · expert 2048layer 31: GQA: 8 query / 2 KV heads · head 128layer 31: MoE: 16 experts, 1 active · expert 2048layer 32: GQA: 8 query / 2 KV heads · head 128layer 32: MoE: 16 experts, 1 active · expert 2048layer 33: GQA: 8 query / 2 KV heads · head 128layer 33: MoE: 16 experts, 1 active · expert 2048layer 34: GQA: 8 query / 2 KV heads · head 128layer 34: MoE: 16 experts, 1 active · expert 2048layer 35: GQA: 8 query / 2 KV heads · head 128layer 35: MoE: 16 experts, 1 active · expert 2048layer 36: GQA: 8 query / 2 KV heads · head 128layer 36: MoE: 16 experts, 1 active · expert 2048layer 37: GQA: 8 query / 2 KV heads · head 128layer 37: MoE: 16 experts, 1 active · expert 2048layer 38: GQA: 8 query / 2 KV heads · head 128layer 38: MoE: 16 experts, 1 active · expert 2048layer 39: GQA: 8 query / 2 KV heads · head 128layer 39: MoE: 16 experts, 1 active · expert 204802039× 40normGQA: 8 query / 2 KV heads · head 128+normMoE: 16 experts, 1 active · expert 2048+full attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)8.8B
Active per token (modelled)1.25B
Without embeddings and output head8.26B total, 715M active
Published weights (Hugging Face count)8.84B
KV cache per token, BF16 (layers that grow with context)40 KiB
KV cache + state at 128K tokens, BF165 GiB
Decode FLOPs per token at 4K context3.17 GFLOP
Prefill FLOPs for a 4K prompt7.23 TFLOP

KV cache against context

ZAYA1-8B: KV cache bytes against context length101001,00010,000100,00098 KiB980 KiB9.5 MiB95 MiB950 MiBcontext (tokens)KV cache + state (BF16)ZAYA1-8B

Compare with other models →

Every architecture field

FieldValueSource
d_model2,048config.jsonconfig.jsonhidden_size
vocab262,272config.jsonconfig.jsonvocab_size
tied_embeddingstrueconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeCCA (compressed convolutional attention) approximated as GQA attentionapproximation
mixers.full.heads8config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads2config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts16config.jsonconfig.jsonnum_experts
ffns.moe.active1config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert2,048config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
layout40× full/moeconfig.jsonconfig.jsonnum_hidden_layers

Sources

Listed in the LLM Architecture Gallery checklist as “ZAYA1-8B (8.4B)” (name only; see about).