llm-architectures-explained

/models

Kolibri-1

Aleph Alpha · Kolibri · open weights

Facts and where they come from

Released2026-10config.jsonconfig.jsonHugging Face repository creation date (api.createdAt)
Licenceapache-2.0config.jsonconfig.jsonREADME metadata: license
Total parameters78Blabmodel cardREADME: Total parameters 78B (78,103,074,560)
Active parametersnot disclosednot disclosed
Context length1M tokenslabmodel cardREADME: Context length 1,048,576 tokens
Norm placementnot disclosednot disclosednot checked in the modelling code
Norm typenot disclosednot disclosednot checked in the modelling code
QK-normnocodemodelling codeno q/k normalisation in the attention block
Positional encodingRoPEcodemodelling coderotary on the full head (default)

Architecture, drawn from the data

40× GQA 48q/4kv, window 513 + 10× GQA 48q/4kv. Each column is one layer: its token mixer above, its feed-forward block below. Paler columns reuse another layer’s keys and values.

Kolibri-1: layer stack and blockslayers (50)mixer / FFNlayer 0: GQA: 48 query / 4 KV heads · head 128 · window 513layer 0: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 1: GQA: 48 query / 4 KV heads · head 128 · window 513layer 1: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 2: GQA: 48 query / 4 KV heads · head 128 · window 513layer 2: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 3: GQA: 48 query / 4 KV heads · head 128 · window 513layer 3: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 4: GQA: 48 query / 4 KV heads · head 128layer 4: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 5: GQA: 48 query / 4 KV heads · head 128 · window 513layer 5: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 6: GQA: 48 query / 4 KV heads · head 128 · window 513layer 6: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 7: GQA: 48 query / 4 KV heads · head 128 · window 513layer 7: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 8: GQA: 48 query / 4 KV heads · head 128 · window 513layer 8: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 9: GQA: 48 query / 4 KV heads · head 128layer 9: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 10: GQA: 48 query / 4 KV heads · head 128 · window 513layer 10: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 11: GQA: 48 query / 4 KV heads · head 128 · window 513layer 11: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 12: GQA: 48 query / 4 KV heads · head 128 · window 513layer 12: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 13: GQA: 48 query / 4 KV heads · head 128 · window 513layer 13: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 14: GQA: 48 query / 4 KV heads · head 128layer 14: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 15: GQA: 48 query / 4 KV heads · head 128 · window 513layer 15: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 16: GQA: 48 query / 4 KV heads · head 128 · window 513layer 16: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 17: GQA: 48 query / 4 KV heads · head 128 · window 513layer 17: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 18: GQA: 48 query / 4 KV heads · head 128 · window 513layer 18: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 19: GQA: 48 query / 4 KV heads · head 128layer 19: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 20: GQA: 48 query / 4 KV heads · head 128 · window 513layer 20: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 21: GQA: 48 query / 4 KV heads · head 128 · window 513layer 21: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 22: GQA: 48 query / 4 KV heads · head 128 · window 513layer 22: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 23: GQA: 48 query / 4 KV heads · head 128 · window 513layer 23: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 24: GQA: 48 query / 4 KV heads · head 128layer 24: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 25: GQA: 48 query / 4 KV heads · head 128 · window 513layer 25: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 26: GQA: 48 query / 4 KV heads · head 128 · window 513layer 26: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 27: GQA: 48 query / 4 KV heads · head 128 · window 513layer 27: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 28: GQA: 48 query / 4 KV heads · head 128 · window 513layer 28: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 29: GQA: 48 query / 4 KV heads · head 128layer 29: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 30: GQA: 48 query / 4 KV heads · head 128 · window 513layer 30: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 31: GQA: 48 query / 4 KV heads · head 128 · window 513layer 31: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 32: GQA: 48 query / 4 KV heads · head 128 · window 513layer 32: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 33: GQA: 48 query / 4 KV heads · head 128 · window 513layer 33: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 34: GQA: 48 query / 4 KV heads · head 128layer 34: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 35: GQA: 48 query / 4 KV heads · head 128 · window 513layer 35: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 36: GQA: 48 query / 4 KV heads · head 128 · window 513layer 36: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 37: GQA: 48 query / 4 KV heads · head 128 · window 513layer 37: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 38: GQA: 48 query / 4 KV heads · head 128 · window 513layer 38: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 39: GQA: 48 query / 4 KV heads · head 128layer 39: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 40: GQA: 48 query / 4 KV heads · head 128 · window 513layer 40: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 41: GQA: 48 query / 4 KV heads · head 128 · window 513layer 41: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 42: GQA: 48 query / 4 KV heads · head 128 · window 513layer 42: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 43: GQA: 48 query / 4 KV heads · head 128 · window 513layer 43: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 44: GQA: 48 query / 4 KV heads · head 128layer 44: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 45: GQA: 48 query / 4 KV heads · head 128 · window 513layer 45: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 46: GQA: 48 query / 4 KV heads · head 128 · window 513layer 46: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 47: GQA: 48 query / 4 KV heads · head 128 · window 513layer 47: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 48: GQA: 48 query / 4 KV heads · head 128 · window 513layer 48: MoE: 384 experts, 6 active · expert 512 · 1 sharedlayer 49: GQA: 48 query / 4 KV heads · head 128layer 49: MoE: 384 experts, 6 active · expert 512 · 1 shared02549× 40GQA: 48 query / 4 KV heads · head 128 · window 513+MoE: 384 experts, 6 active · expert 512 · 1 shared+× 10GQA: 48 query / 4 KV heads · head 128+MoE: 384 experts, 6 active · expert 512 · 1 shared+sliding windowfull attentionMoE FFN

Modelled costs

From the cost model, batch size 1. Totals the lab states are in the table above; differences come from rounding, from what a lab counts, or from parts the model does not describe (listed on the about page).

Parameters (modelled)78.1B
Active per token (modelled)3.78B
Without embeddings and output head77.4B total, 3.13B active
Published weights (Hugging Face count)78.1B
KV cache per token, BF16 (layers that grow with context)20 KiB
KV cache + state at 1M tokens, BF1620 GiB
Decode FLOPs per token at 4K context8.42 GFLOP
Prefill FLOPs for a 4K prompt29.6 TFLOP

KV cache against context

Kolibri-1: KV cache bytes against context length101001,00010,000100,0001,000,000980 KiB9.5 MiB95 MiB950 MiB9.3 GiBcontext (tokens)KV cache + state (BF16)Kolibri-1

Compare with other models →

Every architecture field

FieldValueSource
d_model2,560config.jsonconfig.jsonhidden_size
vocab128,000config.jsonconfig.jsonvocab_size
tied_embeddingsfalseconfig.jsonconfig.jsontie_word_embeddings
mixers.full.typeattncodemodelling codeattention block
mixers.full.heads48config.jsonconfig.jsonnum_attention_heads
mixers.full.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.full.head_dim128config.jsonconfig.jsonhead_dim
mixers.sliding.typeattncodemodelling codeattention block
mixers.sliding.heads48config.jsonconfig.jsonnum_attention_heads
mixers.sliding.kv_heads4config.jsonconfig.jsonnum_key_value_heads
mixers.sliding.head_dim128config.jsonconfig.jsonhead_dim
mixers.sliding.window513config.jsonconfig.jsonsliding_window
ffns.moe.typemoecodemodelling codeMoE block
ffns.moe.experts384config.jsonconfig.jsonnum_experts
ffns.moe.active6config.jsonconfig.jsonnum_experts_per_tok
ffns.moe.d_expert512config.jsonconfig.jsonmoe_intermediate_size
ffns.moe.gatedtruecodemodelling codeexperts are gated MLPs
ffns.moe.shared1codemodelling codeone shared expert of shared_expert_intermediate_size
ffns.moe.d_shared512config.jsonconfig.jsonshared_expert_intermediate_size
layout4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moe · 4× sliding/moe · 1× full/moeconfig.jsonconfig.jsonlayer_types

Sources

Listed in the LLM Architecture Gallery checklist as “Kolibri-1 (78B)” (name only; see about).