llm-architectures-explained

/models

DeepSeek-V4.1-Flash

DeepSeek · DeepSeek V4 · open weights · causal encoder-decoder

Facts and where they come from

Released2026-09config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licencemitconfig.jsonconfig.jsonREADME metadata: license
Total parameters552BpaperarXiv 2609.19969abstract p.1; Table 1 p.24: 552B backbone parameters (plus 196B Engram parameters)
Active parameters16BpaperarXiv 2609.19969abstract p.1: 8B activated per token at prefill, 16B at decode
Context length1M tokensconfig.jsonconfig.jsontext_config.max_position_embeddings
Norm placementnot disclosednot disclosednot checked in the modelling code
Norm typenot disclosednot disclosednot checked in the modelling code
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPE on 12.5% of each headconfig.jsonconfig.jsonqk_rope_head_dim / head_dim

Architecture, drawn from the data

compressed 64h, window 128. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

DeepSeek-V4.1-Flash: layer stack and blockslayers (40)mixer / FFNlayer 0: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV)layer 0: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 1: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV)layer 1: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 2: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 · compression 2layer 2: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 3: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 3: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 4: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 4: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 5: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 5: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 6: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 6: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 7: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 7: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 8: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 · compression 2layer 8: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 9: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 9: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 10: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 10: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 11: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 11: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 12: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 12: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 13: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 13: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 14: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 · compression 2layer 14: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 15: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 15: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 16: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 16: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 17: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 17: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 18: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 18: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 19: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 2layer 19: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 20: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 · compression 1layer 20: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 21: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 21: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 22: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 22: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 23: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 23: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 24: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 24: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 25: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 25: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 26: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 26: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 27: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 27: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 28: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 28: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 29: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 29: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 30: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 30: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 31: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 31: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 32: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 32: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 33: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 33: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 34: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 34: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 35: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 35: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 36: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 36: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 37: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 37: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 38: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 38: MoE: 384 experts, 6 active · expert 2304 · 1 sharedlayer 39: Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512 (reuses another layer's KV) · compression 1layer 39: MoE: 384 experts, 6 active · expert 2304 · 1 shared02039encoder: runs at prefilldecoder: replays the last tokens× 40Compressed attention: 64 heads · latent 512 · window 128 · indexer top-512+MoE: 384 experts, 6 active · expert 2304 · 1 shared+compressed attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)552B
Active per token (modelled)16.6B
Without embeddings and output head550B total, 15.3B active
Multi-token-prediction layers (extra)41.4B
Published weights (Hugging Face count)763B (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)3.13 KiB
KV cache + state at 1M tokens, BF163.13 GiB
Decode FLOPs per token at 4K context45.5 GFLOP
Prefill FLOPs for a 4K prompt75.2 TFLOP

KV cache against context

DeepSeek-V4.1-Flash: KV cache bytes against context length101001,00010,000100,0001,000,0009.5 MiB95 MiB950 MiBcontext (tokens)KV cache + state (BF16)DeepSeek-V4.1-Flash

Compare with other models →

Every architecture field

FieldValueSource
d_model5,120config.jsonconfig.jsontext_config.hidden_size
vocab129,280config.jsonconfig.jsontext_config.vocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontext_config.tie_word_embeddings
mixers.csa.typecsacodemodelling codeDeepSeek V4 compressed attention (CSA/HCA) with a sliding window
mixers.csa.heads64config.jsonconfig.jsontext_config.num_attention_heads
mixers.csa.head_dim512config.jsonconfig.jsontext_config.head_dim
mixers.csa.q_lora_rank1,280config.jsonconfig.jsontext_config.q_lora_rank
mixers.csa.o_lora_rank1,024config.jsonconfig.jsontext_config.o_lora_rank
mixers.csa.o_groups8config.jsonconfig.jsontext_config.o_groups
mixers.csa.window128config.jsonconfig.jsontext_config.sliding_window
mixers.csa.indexer.heads32config.jsonconfig.jsontext_config.index_n_heads
mixers.csa.indexer.head_dim128config.jsonconfig.jsontext_config.index_head_dim
mixers.csa.indexer.topk512config.jsonconfig.jsontext_config.index_topk
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts384config.jsonconfig.jsontext_config.n_routed_experts
ffns.moe.active6config.jsonconfig.jsontext_config.num_experts_per_tok
ffns.moe.d_expert2,304config.jsonconfig.jsontext_config.moe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1config.jsonconfig.jsontext_config.n_shared_experts
ffns.moe.d_shared2,304config.jsonconfig.jsontext_config.moe_intermediate_size
layout2× csa/moe (ratio=0,kv_source=false,indexer=false) · 1× csa/moe (ratio=2,kv_source=true,indexer=true) · 5× csa/moe (ratio=2,kv_source=false,indexer=false) · 1× csa/moe (ratio=2,kv_source=true,indexer=true) · 5× csa/moe (ratio=2,kv_source=false,indexer=false) · 1× csa/moe (ratio=2,kv_source=true,indexer=true) · 5× csa/moe (ratio=2,kv_source=false,indexer=false) · 1× csa/moe (ratio=1,kv_source=true,indexer=true) · 3× csa/moe (ratio=1,kv_source=false,indexer=false) · 1× csa/moe (ratio=1,kv_source=false,indexer=true) · 3× csa/moe (ratio=1,kv_source=false,indexer=false) · 1× csa/moe (ratio=1,kv_source=false,indexer=true) · 3× csa/moe (ratio=1,kv_source=false,indexer=false) · 1× csa/moe (ratio=1,kv_source=false,indexer=true) · 3× csa/moe (ratio=1,kv_source=false,indexer=false) · 1× csa/moe (ratio=1,kv_source=false,indexer=true) · 3× csa/moe (ratio=1,kv_source=false,indexer=false)config.jsonconfig.jsontext_config.compress_ratios, kv_source_layer_ids, index_source_layer_ids
mtp_layers3config.jsonconfig.jsontext_config.num_nextn_predict_layers
ced_encoder_layers20paperarXiv 2609.19969Fig. 3 caption p.7; §2.1: a 20-layer causal encoder and a 20-layer decoder
ced_window128paperarXiv 2609.19969§4.2.1 p.22: n_win = 128 (Decoder SWA Bounded Replay)

Sources

Listed in the LLM Architecture Gallery checklist as “DeepSeek V4.1-Flash (552B)” (name only; see about).