llm-architectures-explained

/models

Trinity Large

Arcee AI · Trinity · open weights

Facts and where they come from

Released2026-01config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceotherconfig.jsonconfig.jsonREADME metadata: license
Total parameters398Blabmodel cardREADME: a 398B-parameter sparse Mixture-of-Experts model
Active parametersnot disclosednot disclosed
Context length8K tokenslabmodel cardREADME: pretraining context length 8,192
Norm placementsandwichcodemodelling codetransformers 5.18.0 afmoe: pre_mlp_layernorm and post_mlp_layernorm around the MLP
Norm typeRMSNormcodemodelling codetransformers 5.18.0 afmoe: pre_mlp_layernorm and post_mlp_layernorm around the MLP
QK-normyescodemodelling codetransformers 5.18.0 afmoe: q_norm and k_norm
Positional encodingRoPEcodemodelling coderotary on the full head (default)
Parallel attention and MLPnocodemodelling codetransformers 5.18.0 afmoe: pre_mlp_layernorm and post_mlp_layernorm around the MLP

Architecture, drawn from the data

45× GQA 48q/8kv, window 4096 + 15× GQA 48q/8kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Trinity Large: layer stack and blockslayers (60)mixer / FFNlayer 0: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 0: Gated MLP: 12288layer 1: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 1: Gated MLP: 12288layer 2: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 2: Gated MLP: 12288layer 3: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 3: Gated MLP: 12288layer 4: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 4: Gated MLP: 12288layer 5: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 5: Gated MLP: 12288layer 6: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 6: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 7: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 7: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 8: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 8: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 9: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 9: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 10: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 10: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 11: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 11: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 12: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 12: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 13: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 13: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 14: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 14: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 15: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 15: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 16: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 16: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 17: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 17: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 18: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 18: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 19: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 19: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 20: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 20: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 21: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 21: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 22: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 22: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 23: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 23: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 24: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 24: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 25: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 25: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 26: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 26: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 27: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 27: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 28: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 28: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 29: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 29: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 30: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 30: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 31: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 31: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 32: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 32: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 33: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 33: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 34: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 34: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 35: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 35: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 36: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 36: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 37: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 37: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 38: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 38: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 39: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 39: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 40: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 40: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 41: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 41: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 42: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 42: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 43: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 43: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 44: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 44: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 45: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 45: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 46: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 46: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 47: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 47: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 48: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 48: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 49: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 49: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 50: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 50: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 51: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 51: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 52: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 52: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 53: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 53: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 54: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 54: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 55: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 55: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 56: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 56: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 57: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 57: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 58: GQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatelayer 58: MoE: 256 experts, 4 active · expert 3072 · 1 sharedlayer 59: GQA: 48 query / 8 KV heads · head 128 · elementwise output gatelayer 59: MoE: 256 experts, 4 active · expert 3072 · 1 shared03059× 40normGQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatenorm+normMoE: 256 experts, 4 active · expert 3072 · 1 sharednorm+× 14normGQA: 48 query / 8 KV heads · head 128 · elementwise output gatenorm+normMoE: 256 experts, 4 active · expert 3072 · 1 sharednorm+× 5normGQA: 48 query / 8 KV heads · head 128 · window 4,096 · elementwise output gatenorm+normGated MLP: 12288norm+× 1normGQA: 48 query / 8 KV heads · head 128 · elementwise output gatenorm+normGated MLP: 12288norm+sliding windowfull attentiondense FFNMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)399B
Active per token (modelled)13.4B
Without embeddings and output head397B total, 12.1B active
Published weights (Hugging Face count)399B
KV cache per token, BF16 (layers that grow with context)60 KiB
KV cache + state at 8K tokens, BF161.17 GiB
Decode FLOPs per token at 4K context31.6 GFLOP
Prefill FLOPs for a 4K prompt112 TFLOP

KV cache against context

Trinity Large: KV cache bytes against context length101001,000980 KiB9.5 MiB95 MiB950 MiBcontext (tokens)KV cache + state (BF16)Trinity Large

Compare with other models →

Every architecture field

FieldValueSource
d_model3,072config.jsonconfig.jsonhidden_size
vocab200,192config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads48config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads8config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.full.qk_normtruecodemodelling codetransformers 5.18.0 afmoe: q_norm and k_norm
mixers.full.gateelementwisecodemodelling codetransformers 5.18.0 afmoe: gated attention output
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads48config.jsonconfig.jsonnum_attention_heads
mixers.sliding.kv_heads8config.jsonconfig.jsonnum_key_value_heads
mixers.sliding.head_dim128config.jsonconfig.jsonhead_dim
mixers.sliding.window4,096config.jsonconfig.jsonsliding_window
mixers.sliding.qk_normtruecodemodelling codetransformers 5.18.0 afmoe: q_norm and k_norm
mixers.sliding.gateelementwisecodemodelling codetransformers 5.18.0 afmoe: gated attention output
ffns.dense.typedensecodemodelling codeMLP block
ffns.dense.d_ff12,288config.jsonconfig.jsonintermediate_size
ffns.dense.gatedtruecodemodelling codeMLP: gated (SwiGLU/GeGLU)
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts256config.jsonconfig.jsonnum_experts
ffns.moe.active4config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert3,072config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1config.jsonconfig.jsonnum_shared_experts
ffns.moe.d_shared3,072config.jsonconfig.jsonmoe_intermediate_size
layout3× sliding/dense · 1× full/dense · 2× sliding/dense · 1× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moe · 3× sliding/moe · 1× full/moeconfig.jsonconfig.jsonlayer_types, num_dense_layers
norms_per_layer4codemodelling codetransformers 5.18.0 afmoe: pre and post norms around attention and MLP

Sources

Listed in the LLM Architecture Gallery checklist as “Arcee AI Trinity Large (400B)” (name only; see about).