llm-architectures-explained

/models

Mistral Large 3

Mistral AI · Mistral Large · open weights · multimodal (text stack modelled)

Facts and where they come from

Released2025-11config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters673Blabmodel cardREADME: a granular MoE language model with 673B params and 39B active
Active parameters39Blabmodel cardREADME: 39B active (41B with the vision encoder)
Context length288K tokensconfig.jsonconfig.jsonmax_position_embeddings
Norm placementnot disclosednot disclosednot checked in the modelling code
Norm typenot disclosednot disclosednot checked in the modelling code
QK-normnocodemodelling codeno q/k normalisation in the attention block (MLA normalises its latent vectors, which is not QK-norm)
Positional encodingRoPE on 33.3% of each headconfig.jsonconfig.jsonqk_rope_head_dim / (qk_nope_head_dim + qk_rope_head_dim): decoupled RoPE

Architecture, drawn from the data

MLA 128h, latent 512. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Mistral Large 3: layer stack and blockslayers (61)mixer / FFNlayer 0: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 0: Gated MLP: 16384layer 1: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 1: Gated MLP: 16384layer 2: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 2: Gated MLP: 16384layer 3: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 3: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 4: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 4: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 5: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 5: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 6: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 6: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 7: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 7: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 8: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 8: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 9: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 9: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 10: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 10: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 11: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 11: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 12: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 12: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 13: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 13: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 14: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 14: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 15: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 15: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 16: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 16: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 17: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 17: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 18: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 18: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 19: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 19: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 20: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 20: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 21: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 21: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 22: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 22: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 23: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 23: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 24: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 24: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 25: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 25: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 26: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 26: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 27: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 27: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 28: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 28: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 29: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 29: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 30: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 30: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 31: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 31: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 32: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 32: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 33: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 33: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 34: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 34: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 35: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 35: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 36: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 36: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 37: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 37: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 38: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 38: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 39: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 39: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 40: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 40: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 41: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 41: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 42: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 42: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 43: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 43: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 44: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 44: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 45: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 45: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 46: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 46: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 47: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 47: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 48: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 48: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 49: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 49: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 50: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 50: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 51: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 51: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 52: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 52: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 53: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 53: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 54: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 54: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 55: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 55: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 56: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 56: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 57: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 57: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 58: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 58: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 59: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 59: MoE: 128 experts, 4 active · expert 4096 · 1 sharedlayer 60: MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536layer 60: MoE: 128 experts, 4 active · expert 4096 · 1 shared03060× 58MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536+MoE: 128 experts, 4 active · expert 4096 · 1 shared+× 3MLA: 128 heads · KV latent 512 + RoPE 64 · Q latent 1536+Gated MLP: 16384+MLAdense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)673B
Active per token (modelled)39.9B
Without embeddings and output head672B total, 38.1B active
KV cache per token, BF16 (layers that grow with context)68.6 KiB
KV cache + state at 288K tokens, BF1619.3 GiB
Decode FLOPs per token at 4K context98.5 GFLOP
Prefill FLOPs for a 4K prompt354 TFLOP

KV cache against context

Mistral Large 3: KV cache bytes against context length101001,00010,000100,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)Mistral Large 3

Compare with other models →

Every architecture field

FieldValueSource
d_model7,168config.jsonconfig.jsondim
vocab131,072config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontied_embeddings
mixers.mla.typemlacodemodelling codemulti-head latent attention
mixers.mla.heads128config.jsonconfig.jsonn_heads
mixers.mla.q_lora_rank1,536config.jsonconfig.jsonq_lora_rank
mixers.mla.kv_lora_rank512config.jsonconfig.jsonkv_lora_rank
mixers.mla.qk_nope128config.jsonconfig.jsonqk_nope_head_dim
mixers.mla.qk_rope64config.jsonconfig.jsonqk_rope_head_dim
mixers.mla.v_head_dim128config.jsonconfig.jsonv_head_dim
ffns.dense.typedensecodemodelling codeMLP
ffns.dense.d_ff16,384config.jsonconfig.jsonhidden_dim
ffns.dense.gatedtruecodemodelling codeSwiGLU
ffns.moe.typemoecodemodelling codeMoE
ffns.moe.experts128config.jsonconfig.jsonmoe.num_experts
ffns.moe.active4config.jsonconfig.jsonmoe.num_experts_per_tok
ffns.moe.d_expert4,096config.jsonconfig.jsonmoe.expert_hidden_dim
ffns.moe.shared1config.jsonconfig.jsonmoe.num_shared_experts
ffns.moe.d_shared4,096config.jsonconfig.jsonmoe.expert_hidden_dim
ffns.moe.gatedtruecodemodelling codeSwiGLU experts
layout3× mla/dense · 58× mla/moeconfig.jsonconfig.jsonn_layers, moe.first_k_dense_replace

Sources

Listed in the LLM Architecture Gallery checklist as “Mistral Large 3 (673B)” (name only; see about).