llm-architectures-explained

/models

Qwen3.8-Flash-Next

Alibaba Cloud (Qwen) · Qwen3.5 · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2026-08config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceotherconfig.jsonconfig.jsonREADME metadata: license
Total parameters125Blabmodel cardREADME: 125B with 6B activated, plus 51B n-gram embedding and 4B MTP
Active parameters6Blabmodel cardREADME: 6B activated
Context length256K tokenslabmodel cardREADME: 262,144 natively
Norm placementnot disclosednot disclosednot checked in the modelling code
Norm typenot disclosednot disclosednot checked in the modelling code
QK-normyescodemodelling codetransformers 5.18.0 qwen4_exp: norm_query and norm_key
Positional encodingmultimodal RoPE on 25% of each headconfig.jsonconfig.jsontext_config.rope_parameters.partial_rotary_factor

Architecture, drawn from the data

36× Gated DeltaNet + 12× GQA 24q/2kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Qwen3.8-Flash-Next: layer stack and blockslayers (48)mixer / FFNlayer 0: Gated DeltaNet: 48 heads · state 128×128 per headlayer 0: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 1: Gated DeltaNet: 48 heads · state 128×128 per headlayer 1: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 2: Gated DeltaNet: 48 heads · state 128×128 per headlayer 2: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 3: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 3: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 4: Gated DeltaNet: 48 heads · state 128×128 per headlayer 4: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 5: Gated DeltaNet: 48 heads · state 128×128 per headlayer 5: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 6: Gated DeltaNet: 48 heads · state 128×128 per headlayer 6: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 7: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 7: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 8: Gated DeltaNet: 48 heads · state 128×128 per headlayer 8: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 9: Gated DeltaNet: 48 heads · state 128×128 per headlayer 9: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 10: Gated DeltaNet: 48 heads · state 128×128 per headlayer 10: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 11: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 11: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 12: Gated DeltaNet: 48 heads · state 128×128 per headlayer 12: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 13: Gated DeltaNet: 48 heads · state 128×128 per headlayer 13: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 14: Gated DeltaNet: 48 heads · state 128×128 per headlayer 14: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 15: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 15: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 16: Gated DeltaNet: 48 heads · state 128×128 per headlayer 16: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 17: Gated DeltaNet: 48 heads · state 128×128 per headlayer 17: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 18: Gated DeltaNet: 48 heads · state 128×128 per headlayer 18: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 19: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 19: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 20: Gated DeltaNet: 48 heads · state 128×128 per headlayer 20: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 21: Gated DeltaNet: 48 heads · state 128×128 per headlayer 21: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 22: Gated DeltaNet: 48 heads · state 128×128 per headlayer 22: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 23: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 23: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 24: Gated DeltaNet: 48 heads · state 128×128 per headlayer 24: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 25: Gated DeltaNet: 48 heads · state 128×128 per headlayer 25: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 26: Gated DeltaNet: 48 heads · state 128×128 per headlayer 26: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 27: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 27: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 28: Gated DeltaNet: 48 heads · state 128×128 per headlayer 28: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 29: Gated DeltaNet: 48 heads · state 128×128 per headlayer 29: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 30: Gated DeltaNet: 48 heads · state 128×128 per headlayer 30: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 31: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 31: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 32: Gated DeltaNet: 48 heads · state 128×128 per headlayer 32: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 33: Gated DeltaNet: 48 heads · state 128×128 per headlayer 33: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 34: Gated DeltaNet: 48 heads · state 128×128 per headlayer 34: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 35: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 35: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 36: Gated DeltaNet: 48 heads · state 128×128 per headlayer 36: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 37: Gated DeltaNet: 48 heads · state 128×128 per headlayer 37: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 38: Gated DeltaNet: 48 heads · state 128×128 per headlayer 38: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 39: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 39: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 40: Gated DeltaNet: 48 heads · state 128×128 per headlayer 40: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 41: Gated DeltaNet: 48 heads · state 128×128 per headlayer 41: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 42: Gated DeltaNet: 48 heads · state 128×128 per headlayer 42: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 43: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 43: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 44: Gated DeltaNet: 48 heads · state 128×128 per headlayer 44: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 45: Gated DeltaNet: 48 heads · state 128×128 per headlayer 45: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 46: Gated DeltaNet: 48 heads · state 128×128 per headlayer 46: MoE: 512 experts, 10 active · expert 640 · 1 sharedlayer 47: GQA: 24 query / 2 KV heads · head 256 · elementwise output gatelayer 47: MoE: 512 experts, 10 active · expert 640 · 1 shared02447× 36Gated DeltaNet: 48 heads · state 128×128 per head+MoE: 512 experts, 10 active · expert 640 · 1 shared+× 12GQA: 24 query / 2 KV heads · head 256 · elementwise output gate+MoE: 512 experts, 10 active · expert 640 · 1 shared+Gated DeltaNetfull attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)125B
Active per token (modelled)6.61B
Without embeddings and output head124B total, 5.34B active
Multi-token-prediction layers (extra)2.59B
Published weights (Hugging Face count)180B (packed low-bit tensors, so not comparable)
KV cache per token, BF16 (layers that grow with context)24 KiB
KV cache + state at 256K tokens, BF166.05 GiB
Decode FLOPs per token at 4K context13.3 GFLOP
Prefill FLOPs for a 4K prompt46.9 TFLOP

KV cache against context

Qwen3.8-Flash-Next: KV cache bytes against context length101001,00010,000100,00095 MiB950 MiBcontext (tokens)KV cache + state (BF16)Qwen3.8-Flash-Next

Compare with other models →

Every architecture field

FieldValueSource
d_model2,560config.jsonconfig.jsontext_config.hidden_size
vocab248,320config.jsonconfig.jsontext_config.vocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontext_config.tie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads24config.jsonconfig.jsontext_config.num_attention_heads
mixers.full.kv_heads2config.jsonconfig.jsontext_config.num_key_value_heads
mixers.full.head_dim256config.jsonconfig.jsontext_config.head_dim
mixers.full.gateelementwisecodemodelling codeoutput_gate_type: sigmoid
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 qwen4_exp_text: q_norm and k_norm
mixers.linear.typedeltanetcodemodelling codeGated DeltaNet linear attention
mixers.linear.k_heads16config.jsonconfig.jsontext_config.linear_num_key_heads
mixers.linear.v_heads48config.jsonconfig.jsontext_config.linear_num_value_heads
mixers.linear.k_head_dim128config.jsonconfig.jsontext_config.linear_key_head_dim
mixers.linear.v_head_dim128config.jsonconfig.jsontext_config.linear_value_head_dim
mixers.linear.conv_kernel4config.jsonconfig.jsontext_config.linear_conv_kernel_dim
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts512config.jsonconfig.jsontext_config.num_experts
ffns.moe.active10config.jsonconfig.jsontext_config.num_experts_per_tok
ffns.moe.d_expert640config.jsonconfig.jsontext_config.moe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1codemodelling codeone shared expert of shared_expert_intermediate_size
ffns.moe.d_shared640config.jsonconfig.jsontext_config.shared_expert_intermediate_size
layout3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moe · 3× linear/moe · 1× full/moeconfig.jsonconfig.jsontext_config.layer_types
mtp_layers1config.jsonconfig.jsontext_config.mtp_num_hidden_layers
mtp_layer{"mixer":"full","ffn":"moe","n":1}codemodelling codeMTP layer: a full-attention block

Sources

Listed in the LLM Architecture Gallery checklist as “Qwen3.8-Flash-Next (125B-A6B)” (name only; see about).