llm-architectures-explained

/models

Models

160 models, from the original Transformer to this year’s releases. Open a model to see every value with its source. Totals are the figures the labs state; an asterisk marks a count modelled from the configuration where no figure is stated.

Must have

160 of 160 models

Attention
Kolibri-1Aleph Alpha2026-1078B3.78B*502,56020 KiB1M40× GQA 48q/4kv, window 513 + 10× GQA 48q/4kv
Claude Fable 5.1closedAnthropic2026-09not disclosed————1,000,000not disclosed
Claude Opus 5.5closedAnthropic2026-09not disclosed————1,000,000not disclosed
DeepSeek-V4.1-FlashDeepSeek2026-09552B16B405,1203.13 KiB1Mcompressed 64h, window 128
Ember-1closedFireworks AI2026-092.78T*106B*937,16827 KiB—69× Kimi Delta Attention + 24× MLA 96h, latent 512
GPT-6 AstraclosedOpenAI2026-09not disclosed————1,050,000not disclosed
MiMo-V2.6-Flash-RLXiaomi2026-09309B15B484,09622.5 KiB1M9× GQA 64q/4kv + 39× GQA 64q/8kv, window 128
MiMo-V2.6-Pro-RLXiaomi2026-091.02T42B706,14450 KiB1M10× GQA 128q/8kv + 60× GQA 128q/8kv, window 128
Naive-N0.5-FlashNaiveAI2026-09309B15.5B484,09622.5 KiB1M9× GQA 64q/4kv + 39× GQA 64q/8kv, window 128
Step 5 PreviewclosedStepFun2026-09600B27B———1,000,000not disclosed
GLM-5.3-FlashZ.ai2026-08320B18B454,09613.8 KiB1M34× Kimi Delta Attention + 11× MLA 64h, latent 512, top-2048
Hy4 previewTencent2026-08770B49B786,14493 KiB1MMLA 64h, latent 512, top-2048
Ling 3.0 FlashInclusionAI2026-08124B*5.2B*422,5607.88 KiB256K35× Kimi Delta Attention + 7× MLA 32h, latent 512
Muse Glimmer 30BMeta2026-0829.6B—526,65613 KiB128K39× GQA 32q/2kv, window 2048 + 13× GQA 32q/2kv
Nemotron 3.5 LightningNVIDIA2026-0830B3B522,6886 KiB1M23× Mamba-2 + 6× GQA 32q/2kv
Ornith 1.5 35B-A3BOrnith2026-0835B3B402,04820 KiB256K30× Gated DeltaNet + 10× GQA 16q/2kv
Qwen3.8 27BAlibaba Cloud (Qwen)2026-0827B—645,12064 KiB256K48× Gated DeltaNet + 16× GQA 24q/4kv
Qwen3.8-Flash-NextAlibaba Cloud (Qwen)2026-08125B6B482,56024 KiB256K36× Gated DeltaNet + 12× GQA 24q/2kv
Antares 1BCisco2026-071.84B*1.84B*402,04880 KiB128KGQA 16q/4kv
BTL-3Bad Theory Labs2026-0727B—645,12064 KiB256K48× Gated DeltaNet + 16× GQA 24q/4kv
Claude Opus 5closedAnthropic2026-07not disclosed—————not disclosed
InklingThinking Machines Lab2026-07975B41B666,14444 KiB—55× GQA 64q/16kv, window 512 + 11× GQA 64q/8kv
Laguna S 2.1Poolside2026-07118B8B483,07248 KiB1M12× GQA 48q/8kv + 36× GQA 72q/8kv, window 512
Motif 3 BetaMotif Technologies2026-07314B13B534,09614.6 KiB256K40× MLA 80h, latent 512, window 128 + 13× MLA 80h, latent 512
Nanbeige4.2 3BBOSS Zhipin2026-074B—223,07288 KiB256KGQA 48q/8kv
Solar Open 2Upstage2026-07250B15B484,09648 KiB1M12× GQA 64q/8kv + 36× Kimi Delta Attention
Soofi SSOOFI Consortium2026-0731.6B3.2B522,6886 KiB256K23× Mamba-2 + 6× GQA 32q/2kv
GLM-5.2Z.ai2026-06744B*41.8B*786,14493 KiB1MMLA 64h, latent 512, top-2048
Kimi K2.7 CodeMoonshot AI2026-061T32.9B*617,16868.6 KiB256KMLA 64h, latent 512
Kimi K3Moonshot AI2026-062.8T106B*937,16827 KiB1M69× Kimi Delta Attention + 24× MLA 96h, latent 512
Laguna XS 2.1Poolside2026-0633B3B402,04840 KiB256K10× GQA 48q/8kv + 30× GQA 64q/8kv, window 512
MiniMax-M3MiniMax2026-06428B23B606,144134 KiB1M3× GQA 64q/4kv + 57× GQA 64q/4kv, top-2176
Nemotron 3 UltraNVIDIA2026-06550B55B1088,19212 KiB1M48× Mamba-2 + 12× GQA 64q/2kv
North Mini Code 1.0Cohere2026-0630B3B492,04826 KiB256K13× GQA 32q/4kv + 36× GQA 32q/4kv, window 4096
VibeThinker-3BWeibo2026-063B—362,04836 KiB128KGQA 16q/2kv
Command A+Cohere2026-05218B25B324,09632 KiB128K24× GQA 128q/8kv, window 4096 + 8× GQA 128q/8kv
Gemma 4 12BGoogle2026-0511.9B—483,8408 KiB256K40× GQA 16q/8kv, window 1024 + 8× MQA 16q/1kv
LFM2.5 8B-A1BLiquid AI2026-058.3B1.5B242,04812 KiB125K18× Short convolution + 6× GQA 32q/8kv
Mellum2 12B-A2.5B ThinkingJetBrains2026-0512B2.5B282,30414 KiB128K21× GQA 32q/4kv, window 1024 + 7× GQA 32q/4kv
ZAYA1-8BZyphra2026-058.4B760M402,04840 KiB128KGQA 8q/2kv
DeepSeek-V4-FlashDeepSeek2026-04284B13.7B*434,0966.72 KiB1Mcompressed 64h, window 128
DeepSeek-V4-ProDeepSeek2026-041.6T49B617,1689.62 KiB1Mcompressed 128h, window 128
GLM-5.1Z.ai2026-04744B*41.8B*786,144107 KiB198KMLA 64h, latent 512, top-2048
Granite 4.1 30BIBM2026-0430B—644,096256 KiB128KGQA 32q/8kv
Hy3 previewTencent2026-04295B21B804,096320 KiB256KGQA 64q/8kv
Kimi K2.6Moonshot AI2026-041T32.9B*617,16868.6 KiB256KMLA 64h, latent 512
Laguna XS.2Poolside2026-0433B3B402,04840 KiB256K10× GQA 48q/8kv + 30× GQA 64q/8kv, window 512
Ling 2.6 1TInclusionAI2026-041T63.6B*808,19211.3 KiB256K70× Linear attention + 10× MLA 64h, latent 512
MiMo-V2.5Xiaomi2026-04310B15B484,09622.5 KiB1M9× GQA 64q/4kv + 39× GQA 64q/8kv, window 128
MiMo-V2.5-ProXiaomi2026-041.02T42B706,14450 KiB1M10× GQA 128q/8kv + 60× GQA 128q/8kv, window 128
MiniMax-M2.7MiniMax2026-04229B*11B*623,072248 KiB200KGQA 48q/8kv
Qwen3.6 27BAlibaba Cloud (Qwen)2026-0427B—645,12064 KiB256K48× Gated DeltaNet + 16× GQA 24q/4kv
Qwen3.6 35B-A3BAlibaba Cloud (Qwen)2026-0435B3B402,04820 KiB256K30× Gated DeltaNet + 10× GQA 16q/2kv
Gemma 4 26B-A4BGoogle2026-0326B4B302,81610 KiB256K25× GQA 16q/8kv, window 1024 + 5× GQA 16q/2kv
Gemma 4 31BGoogle2026-0330.7B—605,37640 KiB256K50× GQA 32q/16kv, window 1024 + 10× GQA 32q/4kv
Gemma 4 E2BGoogle2026-035.1B—351,5366 KiB128K28× MQA 8q/1kv, window 512 + 7× MQA 8q/1kv
Gemma 4 E4BGoogle2026-038B—422,56016 KiB128K35× GQA 8q/2kv, window 512 + 7× GQA 8q/2kv
LFM2.5 350MLiquid AI2026-03350M—161,02412 KiB32K10× Short convolution + 6× GQA 16q/8kv
Nemotron 3 Nano 4BNVIDIA2026-034B—423,13616 KiB256K21× Mamba-2 + 4× GQA 40q/8kv
Nemotron 3 SuperNVIDIA2026-03120B12B884,0968 KiB1M40× Mamba-2 + 8× GQA 32q/2kv
Sarvam 105BSarvam AI2026-03105B10.3B324,09636 KiB128KMLA 64h, latent 512
Sarvam 30BSarvam AI2026-0330B4.52B*194,09619 KiB128KGQA 64q/4kv
GLM-5Z.ai2026-02744B40B786,144107 KiB198KMLA 64h, latent 512, top-2048
Ling 2.5 1TInclusionAI2026-021T63B808,19211.3 KiB128K70× Linear attention + 10× MLA 64h, latent 512
MiniMax-M2.5MiniMax2026-02229B*11B*623,072248 KiB192KGQA 48q/8kv
Nanbeige4.1 3BBOSS Zhipin2026-023B—322,56064 KiB256KGQA 20q/4kv
Qwen3.5 397B-A17BAlibaba Cloud (Qwen)2026-02397B17B604,09630 KiB256K45× Gated DeltaNet + 15× GQA 32q/2kv
Step 3.5 FlashStepFun2026-02196B11B484,09648 KiB256K12× GQA 64q/8kv + 36× GQA 96q/8kv, window 512
Tiny AyaCohere2026-023.35B—362,04818 KiB8K27× GQA 16q/4kv, window 4096 + 9× GQA 16q/4kv
Kimi K2.5Moonshot AI2026-011T32.9B*617,16868.6 KiB256KMLA 64h, latent 512
LFM2.5 1.2BLiquid AI2026-011.17B—162,04812 KiB32K10× Short convolution + 6× GQA 32q/8kv
LongCat-Flash-LiteMeituan2026-0168.5B3B423,07231.5 KiB320KMLA 32h, latent 512
Mistral Small 4Mistral AI2026-01119B6.5B364,09622.5 KiB256KMLA 32h, latent 256
Trinity LargeArcee AI2026-01398B13.4B*603,07260 KiB8K45× GQA 48q/8kv, window 4096 + 15× GQA 48q/8kv
DeepSeek-V3.2DeepSeek2025-12672B*38.4B*617,16883.9 KiB160KMLA 128h, latent 512, top-2048
GLM-4.7Z.ai2025-12353B*33.6B*925,120368 KiB198KGQA 96q/8kv
MiMo-V2-FlashXiaomi2025-12309B15B484,09622.5 KiB256K9× GQA 64q/4kv + 39× GQA 64q/8kv, window 128
Nemotron 3 Nano 30B-A3BNVIDIA2025-1230B3.5B522,6886 KiB256K23× Mamba-2 + 6× GQA 32q/2kv
Gemini 3 ProclosedGoogle2025-11not disclosed————1,000,000not disclosed
INTELLECT-3Prime Intellect2025-11107B*13.4B*464,096184 KiB128KGQA 96q/8kv
Mistral Large 3Mistral AI2025-11673B39B617,16868.6 KiB288KMLA 128h, latent 512
Olmo 3 32BAi22025-1132B—645,12064 KiB64K48× GQA 40q/8kv, window 4096 + 16× GQA 40q/8kv
Kimi Linear 48B-A3BMoonshot AI2025-1048B3B272,3047.88 KiB—20× Kimi Delta Attention + 7× MLA 32h, latent 512
MiniMax-M2MiniMax2025-10230B10B623,072248 KiB192KGQA 48q/8kv
Ouro 2.6B ThinkingByteDance2025-102.6B—482,048384 KiB64KMHA 16q/16kv
Olmo 3 7BAi22025-097B—324,096128 KiB64K24× MHA 32q/32kv, window 4096 + 8× MHA 32q/32kv
Qwen3-Next 80B-A3BAlibaba Cloud (Qwen)2025-0980B3B482,04824 KiB256K36× Gated DeltaNet + 12× GQA 16q/2kv
Gemma 3 270MGoogle2025-08270M—186403 KiB32K15× MQA 4q/1kv, window 512 + 3× MQA 4q/1kv
GPT-5closedOpenAI2025-08not disclosed————400,000not disclosed
gpt-oss-120bOpenAI2025-08117B5.1B362,88036 KiB128K18× GQA 64q/8kv, window 128 + 18× GQA 64q/8kv
gpt-oss-20bOpenAI2025-0821B3.6B242,88024 KiB128K12× GQA 64q/8kv, window 128 + 12× GQA 64q/8kv
Grok 2.5xAI2025-08270B*115B*648,192256 KiB128KGQA 64q/8kv
GLM-4.5Z.ai2025-07355B32B925,120368 KiB128KGQA 96q/8kv
GLM-4.5-AirZ.ai2025-07106B12B464,096184 KiB128KGQA 96q/8kv
Grok 4closedxAI2025-07not disclosed————250Knot disclosed
Kimi K2Moonshot AI2025-071T32B617,16868.6 KiB128KMLA 64h, latent 512
Qwen3-Coder 30B-A3BAlibaba Cloud (Qwen)2025-0730.5B3.3B482,04896 KiB256KGQA 32q/4kv
SmolLM3 3BHugging Face2025-063B—362,04872 KiB64KGQA 16q/4kv
Llama 4 MaverickMeta2025-04400B17B485,12048 KiB1,000,00036× GQA 40q/8kv, chunks of 8192 + 12× GQA 40q/8kv
Qwen3 0.6BAlibaba Cloud (Qwen)2025-04600M—281,024112 KiB32KGQA 16q/8kv
Qwen3 235B-A22BAlibaba Cloud (Qwen)2025-04235B22B944,096188 KiB32KGQA 64q/4kv
Qwen3 30B-A3BAlibaba Cloud (Qwen)2025-0430.5B3.3B482,04896 KiB32KGQA 32q/4kv
Qwen3 32BAlibaba Cloud (Qwen)2025-0432.8B—645,120256 KiB32KGQA 64q/8kv
Qwen3 4BAlibaba Cloud (Qwen)2025-044B—362,560144 KiB32KGQA 32q/8kv
Qwen3 8BAlibaba Cloud (Qwen)2025-048.2B—364,096144 KiB32KGQA 32q/8kv
Gemini 2.5 ProclosedGoogle2025-03not disclosed—————not disclosed
Gemma 3 27BGoogle2025-0327B—625,37680 KiB128K52× GQA 32q/16kv, window 1024 + 10× GQA 32q/16kv
Mistral Small 3.1Mistral AI2025-0324B—405,120160 KiB128KGQA 32q/8kv
DeepSeek-R1DeepSeek2025-01671B37B617,16868.6 KiB160KMLA 128h, latent 512
MiniMax-Text-01MiniMax2025-01456B45.9B806,14440 KiB10000K70× Linear attention + 10× GQA 64q/8kv
DeepSeek-V3DeepSeek2024-12671B37B617,16868.6 KiB160KMLA 128h, latent 512
OLMo 2 7BAi22024-127B—324,096512 KiB4KMHA 32q/32kv
Phi-4Microsoft2024-1214B—405,120200 KiB16KGQA 40q/10kv
xLSTM 7BNXAI2024-127B—324,0960 B—mLSTM
Llama 3.2 1BMeta2024-091.23B—162,04832 KiB128KGQA 32q/8kv
Llama 3.2 3BMeta2024-093.21B—283,072112 KiB128KGQA 24q/8kv
o1-previewclosedOpenAI2024-09not disclosed————125Knot disclosed
Qwen2.5 72BAlibaba Cloud (Qwen)2024-0972.7B—808,192320 KiB128KGQA 64q/8kv
GPT-4o miniclosedOpenAI2024-07not disclosed————125Knot disclosed
Llama 3.1 405BMeta2024-07405B—12616,384504 KiB128KGQA 128q/8kv
OLMoE-1B-7BAi22024-077B1B162,048128 KiB4KMHA 16q/16kv
RWKV-6 Finch 14BRWKV2024-0714B—614,0960 B—RWKV
Claude 3.5 SonnetclosedAnthropic2024-06not disclosed————200,000not disclosed
Gemma 2 27BGoogle2024-0627B—464,608184 KiB8K23× GQA 32q/16kv, window 4096 + 23× GQA 32q/16kv
GPT-4oclosedOpenAI2024-05not disclosed————125Knot disclosed
Mamba-2 2.7BCarnegie Mellon / Princeton2024-052.7B—642,5600 B—Mamba-2
DeepSeek-V2DeepSeek2024-04236B21B605,12067.5 KiB160KMLA 128h, latent 512
Llama 3 8BMeta2024-048B—324,096128 KiB8KGQA 32q/8kv
Mixtral 8x22BMistral AI2024-04141B*39.2B*566,144224 KiB64KGQA 48q/8kv
Phi-3-miniMicrosoft2024-043.8B—323,072384 KiB4KMHA 32q/32kv
Claude 3 OpusclosedAnthropic2024-03not disclosed————200,000not disclosed
Grok-1xAI2024-03314B83.8B*646,144256 KiB8KGQA 48q/8kv
Jamba v0.1AI21 Labs2024-0352B12B324,09616 KiB256K28× Mamba + 4× GQA 32q/8kv
Gemini 1.5 ProclosedGoogle2024-02not disclosed—————not disclosed
Qwen1.5-MoE-A2.7BAlibaba Cloud (Qwen)2024-0214.3B2.7B242,048192 KiB8KMHA 16q/16kv
DeepSeekMoE 16BDeepSeek2024-0116B2.83B*282,048224 KiB4KMHA 16q/16kv
Gemini 1.0 UltraclosedGoogle2023-12not disclosed—————not disclosed
Mamba 2.8BCarnegie Mellon / Princeton2023-122.8B—642,5600 B—Mamba
Mixtral 8x7BMistral AI2023-1247B13B324,096128 KiB32KGQA 32q/8kv
Mistral 7BMistral AI2023-097B—324,0960 B32KGQA 32q/8kv, window 4096
Llama 2 70BMeta2023-0770B—808,192320 KiB4KGQA 64q/8kv
Falcon-40BTII2023-0540B—608,192120 KiB—GQA 128q/8kv
Falcon-7BTII2023-057B—324,5448 KiB—MQA 71q/1kv
RWKV-4 14BRWKV2023-0514B—405,1200 B1KRWKV
GPT-3.5 Turbo (ChatGPT)closedOpenAI2023-03not disclosed————16,385not disclosed
GPT-4closedOpenAI2023-03not disclosed————8Knot disclosed
LLaMA 65BMeta2023-0265.2B—808,1922.5 MiB2KMHA 64q/64kv
BLOOMBigScience2022-11176B—7014,3363.83 MiB—MHA 112q/112kv
OPT-66BMeta2022-0566B—649,2162.25 MiB2KMHA 72q/72kv
GPT-NeoX-20BEleutherAI2022-0420B—446,1441.03 MiB2KMHA 64q/64kv
PaLM 540BclosedGoogle2022-04540B—11818,432118 KiB2KMQA 48q/1kv
Chinchilla 70BclosedGoogle DeepMind2022-0370B—808,1922.5 MiB2KMHA 64q/64kv
GLaM (64B/64E)closedGoogle2021-121.2T96.6B648,1924 MiB—MHA 128q/128kv
GPT-J 6BEleutherAI2021-066B—284,096448 KiB2KMHA 16q/16kv
Switch-CGoogle2021-011.57T1.73B*152,080240 KiB—MHA 32q/32kv
GPT-3 175BclosedOpenAI2020-05175B—9612,2884.5 MiB2KMHA 96q/96kv
T5 11BGoogle2019-1011B—241,0243 MiB512MHA 128q/128kv
GPT-2 XLOpenAI2019-021.5B—481,600300 KiB1KMHA 25q/25kv
BERT-LargeGoogle2018-10340M—241,02496 KiB512MHA 16q/16kv
Transformer (base)Google2017-0665M—651224 KiB—MHA 8q/8kv

* modelled from the configuration where the lab states no figure. KV / token: bytes added per token in BF16 by the layers whose cache grows with context (windowed and recurrent layers excluded).