Veröffentlichungszeitsrah
Jede Open-Weight-Veröffentlichung des Korpus, aufgetragen nach Veröffentlichungsdatum (horizontal) und Gesamtparametern auf logarithmischer Skala (vertikal). Das Band 2024–2026 zeigt die branchenweite Wende zu sparsamen Mixture-of-Experts: Gesamtparameter wachsen um Größenordnungen, während die aktiven Parameter pro Token klein bleiben.
- GPT-2 OpenAI · 1.24 Mrd. · MHA
- GPT-3 175B (paper) OpenAI · 175 Mrd. · MHA
- LLaMA 1 7B Meta · 6.74 Mrd. · MHA
- Llama 2 70B Meta · 68.98 Mrd. · GQA
- Mistral 7B Mistral · 7.24 Mrd. · GQA
- ChatGLM3 6B GLM · 6.2 Mrd. · GQA
- DeepSeek-Coder 6.7B DeepSeek · 6.7 Mrd. · MHA
- DeepSeek LLM 7B DeepSeek · 5.9 Mrd. · MHA
- DeepSeekMoE 16B DeepSeek · 16.2 Mrd. · MHA · MoE
- Qwen1.5 7B Qwen · 6.6 Mrd. · MHA
- Mixtral 8x22B Mistral · 140.6 Mrd. · GQA · MoE
- DeepSeek-V2 DeepSeek · 236 Mrd. · MLA · MoE
- DeepSeek-V2 Lite DeepSeek · 15.6 Mrd. · MLA · MoE
- GLM-4 9B GLM · 9.4 Mrd. · GQA
- Qwen2 72B Qwen · 71.4 Mrd. · GQA
- Llama 3.1 70B Meta · 70.55 Mrd. · GQA
- Llama 3.1 8B Meta · 8.03 Mrd. · GQA
- Qwen2.5 72B Qwen · 71.4 Mrd. · GQA
- Qwen2.5 7B Qwen · 7.6 Mrd. · GQA
- DeepSeek-V3 DeepSeek · 671 Mrd. · MLA · MoE
- DeepSeek-V3 Base DeepSeek · 671 Mrd. · MLA · MoE
- DeepSeek-R1 DeepSeek · 671 Mrd. · MLA · MoE
- MiniMax-Text-01 MiniMax · 456 Mrd. · GQA · MoE
- Moonlight 16B Kimi · 15.8 Mrd. · MLA · MoE
- Qwen3 0.6B Qwen · 0.6 Mrd. · GQA
- Qwen3 235B A22B Qwen · 234.6 Mrd. · GQA · MoE
- Qwen3 30B A3B Qwen · 30.4 Mrd. · GQA · MoE
- Qwen3 32B Qwen · 32.1 Mrd. · GQA
- Qwen3 8B Qwen · 7.9 Mrd. · GQA
- MiniMax-M1 MiniMax · 456 Mrd. · GQA · MoE
- GLM-4.5 GLM · 360.4 Mrd. · GQA · MoE
- GLM-4.5-Air GLM · 107.7 Mrd. · GQA · MoE
- Kimi K2 Base Kimi · 1040.2 Mrd. · MLA · MoE
- Step-3 StepFun · 321 Mrd. · MHA · MoE
- DeepSeek-V3.1 DeepSeek · 671 Mrd. · MLA · MoE
- Hunyuan 7B Hunyuan · 7.8 Mrd. · GQA
- GPT-OSS 120B OpenAI · 116.8 Mrd. · GQA · MoE
- GPT-OSS 20B OpenAI · 20.9 Mrd. · GQA · MoE
- DeepSeek-V3.2 DeepSeek · 671 Mrd. · MLA · MoE
- Kimi K2 0905 Kimi · 1040.2 Mrd. · MLA · MoE
- Qwen3-Next 80B A3B Qwen · 78.7 Mrd. · GQA · MoE
- GLM-4.6 GLM · 360.4 Mrd. · GQA · MoE
- Kimi Linear 48B A3B Kimi · 50 Mrd. · MLA · MoE
- MiniMax-M2 MiniMax · 228.3 Mrd. · GQA · MoE
- GLM-4.7-Flash GLM · 29.4 Mrd. · MLA · MoE
- Qwen3-Coder-Next Qwen · 78.7 Mrd. · GQA · MoE
- GLM-5 GLM · 744 Mrd. · MLA · MoE
- Kimi K2.5 Kimi · 1040.2 Mrd. · MLA · MoE
- MiniMax-M2.5 MiniMax · 228.3 Mrd. · GQA · MoE
- Qwen3.5 122B A10B Qwen · 119.9 Mrd. · GQA · MoE
- Qwen3.5 27B Qwen · 23.7 Mrd. · GQA
- Qwen3.5 35B A3B Qwen · 33.9 Mrd. · GQA · MoE
- Qwen3.5 397B A17B Qwen · 392.6 Mrd. · GQA · MoE
- Qwen3.5 9B Qwen · 7.9 Mrd. · GQA
- Qwen3.5 9B Base Qwen · 7.9 Mrd. · GQA
- Step-3.5-Flash StepFun · 196 Mrd. · MHA · MoE
- DeepSeek-V4-Flash DeepSeek · 284 Mrd. · MQA · MoE
- DeepSeek-V4-Flash Base DeepSeek · 284 Mrd. · MQA · MoE
- DeepSeek-V4-Pro DeepSeek · 1606.6 Mrd. · MQA · MoE
- GLM-5.1 GLM · 744 Mrd. · MLA · MoE
- Hunyuan 3 Preview Hunyuan · 296.3 Mrd. · GQA · MoE
- Hunyuan 3 Preview Base Hunyuan · 296.3 Mrd. · GQA · MoE
- Kimi K2.6 Kimi · 1040.2 Mrd. · MLA · MoE
- MiniMax-M2.7 MiniMax · 228.3 Mrd. · GQA · MoE
- Qwen3.6 27B Qwen · 23.7 Mrd. · GQA
- Qwen3.6 35B A3B Qwen · 33.9 Mrd. · GQA · MoE
- Hunyuan-TurboS 30B A3B Hunyuan · 30.3 Mrd. · GQA · MoE
- Hunyuan-TurboS 7B Hunyuan · 7.8 Mrd. · GQA
- Step-3.7-Flash StepFun · 198 Mrd. · MHA · MoE
- GLM-5.2 GLM · 767.4 Mrd. · MLA · MoE
- MiniMax-M3 MiniMax · 443.4 Mrd. · GQA · MoE
- MiniMax-M3 MXFP8 MiniMax · 443.4 Mrd. · GQA · MoE
- Hunyuan 3 Hunyuan · 296.3 Mrd. · GQA · MoE
- Kimi K3 Kimi · 2780 Mrd. · MLA · MoE
- GLM-5.3 GLM · 767.4 Mrd. · MLA · MoE
- GLM-5.3-Flash GLM · 328.9 Mrd. · MLA · MoE
- Hunyuan 4 Preview Hunyuan · 770 Mrd. · MLA · MoE
- Qwen3.8 2.4T A95B Qwen · 2399.6 Mrd. · GQA · MoE
- Qwen3.8 27B Qwen · 23.7 Mrd. · GQA
- Qwen3.8-Flash-Next Qwen · 123.6 Mrd. · GQA · MoE