llm-architectures-explained

/models

DeepSeek-V4-Pro

DeepSeek · DeepSeek V4 · open weights

Facts and where they come from

Released2026-04config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parameters1.6Tlabmodel cardREADME: DeepSeek-V4-Pro with 1.6T parameters (49B activated)
Active parameters49Blabmodel cardREADME: 49B activated
Context length1M tokensconfig.jsonconfig.jsonmax_position_embeddings
Norm placementprecodemodelling codetransformers 5.18.0 / repo modelling code for deepseek_v4: input_layernorm before attention, post_attention_layernorm before the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 / repo modelling code for deepseek_v4: input_layernorm before attention, post_attention_layernorm before the MLP
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPE on 12.5% of each headconfig.jsonconfig.jsonqk_rope_head_dim / head_dim
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 / repo modelling code for deepseek_v4: input_layernorm before attention, post_attention_layernorm before the MLP

Architecture, drawn from the data

compressed 128h, window 128. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

DeepSeek-V4-Pro: layer stack and blockslayers (61)mixer / FFNlayer 0: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 0: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 1: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 1: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 2: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 2: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 3: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 3: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 4: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 4: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 5: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 5: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 6: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 6: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 7: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 7: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 8: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 8: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 9: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 9: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 10: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 10: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 11: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 11: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 12: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 12: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 13: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 13: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 14: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 14: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 15: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 15: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 16: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 16: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 17: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 17: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 18: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 18: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 19: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 19: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 20: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 20: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 21: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 21: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 22: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 22: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 23: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 23: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 24: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 24: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 25: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 25: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 26: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 26: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 27: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 27: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 28: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 28: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 29: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 29: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 30: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 30: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 31: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 31: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 32: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 32: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 33: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 33: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 34: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 34: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 35: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 35: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 36: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 36: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 37: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 37: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 38: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 38: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 39: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 39: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 40: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 40: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 41: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 41: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 42: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 42: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 43: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 43: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 44: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 44: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 45: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 45: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 46: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 46: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 47: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 47: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 48: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 48: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 49: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 49: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 50: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 50: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 51: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 51: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 52: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 52: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 53: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 53: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 54: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 54: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 55: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 55: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 56: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 56: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 57: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 57: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 58: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 58: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 59: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 128layer 59: MoE: 384 experts, 6 active · expert 3072 · 1 sharedlayer 60: Compressed attention: 128 heads · latent 512 · window 128 · indexer top-1024 · compression 4layer 60: MoE: 384 experts, 6 active · expert 3072 · 1 shared03060× 61normCompressed attention: 128 heads · latent 512 · window 128 · indexer top-1024+normMoE: 384 experts, 6 active · expert 3072 · 1 shared+compressed attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)1.57T
Active per token (modelled)49.4B
Without embeddings and output head1.57T total, 47.5B active
Multi-token-prediction layers (extra)25.9B
Published weights (Hugging Face count)1.6T (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)9.62 KiB
KV cache + state at 1M tokens, BF169.62 GiB
Decode FLOPs per token at 4K context109 GFLOP
Prefill FLOPs for a 4K prompt419 TFLOP

KV cache against context

DeepSeek-V4-Pro: KV cache bytes against context length101001,00010,000100,0001,000,0009.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)DeepSeek-V4-Pro

Compare with other models →

Every architecture field

FieldValueSource
d_model7,168config.jsonconfig.jsonhidden_size
vocab129,280config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.csa.typecsacodemodelling codeDeepSeek V4 compressed attention (CSA/HCA) with a sliding window
mixers.csa.heads128config.jsonconfig.jsonnum_attention_heads
mixers.csa.head_dim512config.jsonconfig.jsonhead_dim
mixers.csa.q_lora_rank1,536config.jsonconfig.jsonq_lora_rank
mixers.csa.o_lora_rank1,024config.jsonconfig.jsono_lora_rank
mixers.csa.o_groups16config.jsonconfig.jsono_groups
mixers.csa.window128config.jsonconfig.jsonsliding_window
mixers.csa.indexer.heads64config.jsonconfig.jsonindex_n_heads
mixers.csa.indexer.head_dim128config.jsonconfig.jsonindex_head_dim
mixers.csa.indexer.topk1,024config.jsonconfig.jsonindex_topk
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts384config.jsonconfig.jsonn_routed_experts
ffns.moe.active6config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert3,072config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1config.jsonconfig.jsonn_shared_experts
ffns.moe.d_shared3,072config.jsonconfig.jsonmoe_intermediate_size
layout2× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true) · 1× csa/moe (ratio=128,indexer=false) · 1× csa/moe (ratio=4,indexer=true)config.jsonconfig.jsoncompress_ratios (indexer on ratio-4 layers)
mtp_layers1config.jsonconfig.jsonnum_nextn_predict_layers

Sources

Listed in the LLM Architecture Gallery checklist as “DeepSeek V4-Pro (1.6T)” (name only; see about).