Chronologie des publications
Chaque publication à poids ouverts du corpus, tracée par date de publication (axe horizontal) et paramètres totaux sur une échelle logarithmique (axe vertical). La bande 2024–2026 révèle le pivot de toute l'industrie vers les mélanges d'experts épars : les paramètres totaux croissent de plusieurs ordres de grandeur tandis que les paramètres actifs par token restent faibles.
- GPT-2 OpenAI · 1.24 Md · MHA
- GPT-3 175B (paper) OpenAI · 175 Md · MHA
- LLaMA 1 7B Meta · 6.74 Md · MHA
- Llama 2 70B Meta · 68.98 Md · GQA
- Mistral 7B Mistral · 7.24 Md · GQA
- ChatGLM3 6B GLM · 6.2 Md · GQA
- DeepSeek-Coder 6.7B DeepSeek · 6.7 Md · MHA
- DeepSeek LLM 7B DeepSeek · 5.9 Md · MHA
- DeepSeekMoE 16B DeepSeek · 16.2 Md · MHA · MoE
- Qwen1.5 7B Qwen · 6.6 Md · MHA
- Mixtral 8x22B Mistral · 140.6 Md · GQA · MoE
- DeepSeek-V2 DeepSeek · 236 Md · MLA · MoE
- DeepSeek-V2 Lite DeepSeek · 15.6 Md · MLA · MoE
- GLM-4 9B GLM · 9.4 Md · GQA
- Qwen2 72B Qwen · 71.4 Md · GQA
- Llama 3.1 70B Meta · 70.55 Md · GQA
- Llama 3.1 8B Meta · 8.03 Md · GQA
- Qwen2.5 72B Qwen · 71.4 Md · GQA
- Qwen2.5 7B Qwen · 7.6 Md · GQA
- DeepSeek-V3 DeepSeek · 671 Md · MLA · MoE
- DeepSeek-V3 Base DeepSeek · 671 Md · MLA · MoE
- DeepSeek-R1 DeepSeek · 671 Md · MLA · MoE
- MiniMax-Text-01 MiniMax · 456 Md · GQA · MoE
- Moonlight 16B Kimi · 15.8 Md · MLA · MoE
- Qwen3 0.6B Qwen · 0.6 Md · GQA
- Qwen3 235B A22B Qwen · 234.6 Md · GQA · MoE
- Qwen3 30B A3B Qwen · 30.4 Md · GQA · MoE
- Qwen3 32B Qwen · 32.1 Md · GQA
- Qwen3 8B Qwen · 7.9 Md · GQA
- MiniMax-M1 MiniMax · 456 Md · GQA · MoE
- GLM-4.5 GLM · 360.4 Md · GQA · MoE
- GLM-4.5-Air GLM · 107.7 Md · GQA · MoE
- Kimi K2 Base Kimi · 1040.2 Md · MLA · MoE
- Step-3 StepFun · 321 Md · MHA · MoE
- DeepSeek-V3.1 DeepSeek · 671 Md · MLA · MoE
- Hunyuan 7B Hunyuan · 7.8 Md · GQA
- GPT-OSS 120B OpenAI · 116.8 Md · GQA · MoE
- GPT-OSS 20B OpenAI · 20.9 Md · GQA · MoE
- DeepSeek-V3.2 DeepSeek · 671 Md · MLA · MoE
- Kimi K2 0905 Kimi · 1040.2 Md · MLA · MoE
- Qwen3-Next 80B A3B Qwen · 78.7 Md · GQA · MoE
- GLM-4.6 GLM · 360.4 Md · GQA · MoE
- Kimi Linear 48B A3B Kimi · 50 Md · MLA · MoE
- MiniMax-M2 MiniMax · 228.3 Md · GQA · MoE
- GLM-4.7-Flash GLM · 29.4 Md · MLA · MoE
- Qwen3-Coder-Next Qwen · 78.7 Md · GQA · MoE
- GLM-5 GLM · 744 Md · MLA · MoE
- Kimi K2.5 Kimi · 1040.2 Md · MLA · MoE
- MiniMax-M2.5 MiniMax · 228.3 Md · GQA · MoE
- Qwen3.5 122B A10B Qwen · 119.9 Md · GQA · MoE
- Qwen3.5 27B Qwen · 23.7 Md · GQA
- Qwen3.5 35B A3B Qwen · 33.9 Md · GQA · MoE
- Qwen3.5 397B A17B Qwen · 392.6 Md · GQA · MoE
- Qwen3.5 9B Qwen · 7.9 Md · GQA
- Qwen3.5 9B Base Qwen · 7.9 Md · GQA
- Step-3.5-Flash StepFun · 196 Md · MHA · MoE
- DeepSeek-V4-Flash DeepSeek · 284 Md · MQA · MoE
- DeepSeek-V4-Flash Base DeepSeek · 284 Md · MQA · MoE
- DeepSeek-V4-Pro DeepSeek · 1606.6 Md · MQA · MoE
- GLM-5.1 GLM · 744 Md · MLA · MoE
- Hunyuan 3 Preview Hunyuan · 296.3 Md · GQA · MoE
- Hunyuan 3 Preview Base Hunyuan · 296.3 Md · GQA · MoE
- Kimi K2.6 Kimi · 1040.2 Md · MLA · MoE
- MiniMax-M2.7 MiniMax · 228.3 Md · GQA · MoE
- Qwen3.6 27B Qwen · 23.7 Md · GQA
- Qwen3.6 35B A3B Qwen · 33.9 Md · GQA · MoE
- Hunyuan-TurboS 30B A3B Hunyuan · 30.3 Md · GQA · MoE
- Hunyuan-TurboS 7B Hunyuan · 7.8 Md · GQA
- Step-3.7-Flash StepFun · 198 Md · MHA · MoE
- GLM-5.2 GLM · 767.4 Md · MLA · MoE
- MiniMax-M3 MiniMax · 443.4 Md · GQA · MoE
- MiniMax-M3 MXFP8 MiniMax · 443.4 Md · GQA · MoE
- Hunyuan 3 Hunyuan · 296.3 Md · GQA · MoE
- Kimi K3 Kimi · 2780 Md · MLA · MoE
- GLM-5.3 GLM · 767.4 Md · MLA · MoE
- GLM-5.3-Flash GLM · 328.9 Md · MLA · MoE
- Hunyuan 4 Preview Hunyuan · 770 Md · MLA · MoE
- Qwen3.8 2.4T A95B Qwen · 2399.6 Md · GQA · MoE
- Qwen3.8 27B Qwen · 23.7 Md · GQA
- Qwen3.8-Flash-Next Qwen · 123.6 Md · GQA · MoE