모델 월

전체 코퍼스를 카드 월로 제시합니다. 80개 아키텍처의 연구소, 공개일, 규모, 어텐션 클래스, MoE 구성을 공개 순으로 배열했습니다.

OpenAI GPT-2 · 1.24 B MHA OpenAI GPT-3 175B (paper) · 175 B MHA Meta LLaMA 1 7B · 6.74 B MHA Meta Llama 2 70B · 68.98 B GQA Mistral Mistral 7B · 7.24 B GQA GLM ChatGLM3 6B · 6.2 B GQA DeepSeek DeepSeek-Coder 6.7B · 6.7 B MHA DeepSeek DeepSeek LLM 7B · 5.9 B MHA DeepSeek DeepSeekMoE 16B · 16.2 B · 64e top6 +2shared MHA Qwen Qwen1.5 7B · 6.6 B MHA Mistral Mixtral 8x22B · 140.6 B · 8e top2 GQA DeepSeek DeepSeek-V2 · 236 B · 160e top6 +2shared MLA DeepSeek DeepSeek-V2 Lite · 15.6 B · 64e top6 +2shared MLA GLM GLM-4 9B · 9.4 B GQA Qwen Qwen2 72B · 71.4 B GQA Meta Llama 3.1 70B · 70.55 B GQA Meta Llama 3.1 8B · 8.03 B GQA Qwen Qwen2.5 72B · 71.4 B GQA Qwen Qwen2.5 7B · 7.6 B GQA DeepSeek DeepSeek-V3 · 671 B · 256e top8 +1shared MLA DeepSeek DeepSeek-V3 Base · 671 B · 256e top8 +1shared MLA DeepSeek DeepSeek-R1 · 671 B · 256e top8 +1shared MLA MiniMax MiniMax-Text-01 · 456 B · 32e top2 GQA Kimi Moonlight 16B · 15.8 B · 64e top6 +2shared MLA Qwen Qwen3 0.6B · 0.6 B GQA Qwen Qwen3 235B A22B · 234.6 B · 128e top8 GQA Qwen Qwen3 30B A3B · 30.4 B · 128e top8 GQA Qwen Qwen3 32B · 32.1 B GQA Qwen Qwen3 8B · 7.9 B GQA MiniMax MiniMax-M1 · 456 B · 32e top2 GQA GLM GLM-4.5 · 360.4 B · 160e top8 +1shared GQA GLM GLM-4.5-Air · 107.7 B · 128e top8 +1shared GQA Kimi Kimi K2 Base · 1040.2 B · 384e top8 +1shared MLA StepFun Step-3 · 321 B · 48e top3 +1shared MHA DeepSeek DeepSeek-V3.1 · 671 B · 256e top8 +1shared MLA Hunyuan Hunyuan 7B · 7.8 B GQA OpenAI GPT-OSS 120B · 116.8 B · 128e top4 GQA OpenAI GPT-OSS 20B · 20.9 B · 32e top4 GQA DeepSeek DeepSeek-V3.2 · 671 B · 256e top8 +1shared MLA Kimi Kimi K2 0905 · 1040.2 B · 384e top8 +1shared MLA Qwen Qwen3-Next 80B A3B · 78.7 B · 512e top10 +1shared GQA GLM GLM-4.6 · 360.4 B · 160e top8 +1shared GQA Kimi Kimi Linear 48B A3B · 50 B · 256e top8 +1shared MLA MiniMax MiniMax-M2 · 228.3 B · 256e top8 GQA GLM GLM-4.7-Flash · 29.4 B · 64e top4 +1shared MLA Qwen Qwen3-Coder-Next · 78.7 B · 512e top10 +1shared GQA GLM GLM-5 · 744 B · 256e top8 +1shared MLA Kimi Kimi K2.5 · 1040.2 B · 384e top8 +1shared MLA MiniMax MiniMax-M2.5 · 228.3 B · 256e top8 GQA Qwen Qwen3.5 122B A10B · 119.9 B · 256e top8 +1shared GQA Qwen Qwen3.5 27B · 23.7 B GQA Qwen Qwen3.5 35B A3B · 33.9 B · 256e top8 +1shared GQA Qwen Qwen3.5 397B A17B · 392.6 B · 512e top10 +1shared GQA Qwen Qwen3.5 9B · 7.9 B GQA Qwen Qwen3.5 9B Base · 7.9 B GQA StepFun Step-3.5-Flash · 196 B · 288e top8 +1shared MHA DeepSeek DeepSeek-V4-Flash · 284 B · 256e top6 +1shared MQA DeepSeek DeepSeek-V4-Flash Base · 284 B · 256e top6 +1shared MQA DeepSeek DeepSeek-V4-Pro · 1606.6 B · 384e top6 +1shared MQA GLM GLM-5.1 · 744 B · 256e top8 +1shared MLA Hunyuan Hunyuan 3 Preview · 296.3 B · 192e top8 +1shared GQA Hunyuan Hunyuan 3 Preview Base · 296.3 B · 192e top8 +1shared GQA Kimi Kimi K2.6 · 1040.2 B · 384e top8 +1shared MLA MiniMax MiniMax-M2.7 · 228.3 B · 256e top8 GQA Qwen Qwen3.6 27B · 23.7 B GQA Qwen Qwen3.6 35B A3B · 33.9 B · 256e top8 +1shared GQA Hunyuan Hunyuan-TurboS 30B A3B · 30.3 B · 128e top8 +1shared GQA Hunyuan Hunyuan-TurboS 7B · 7.8 B GQA StepFun Step-3.7-Flash · 198 B · 288e top8 +1shared MHA GLM GLM-5.2 · 767.4 B · 256e top8 +1shared MLA MiniMax MiniMax-M3 · 443.4 B · 128e top4 +1shared GQA MiniMax MiniMax-M3 MXFP8 · 443.4 B · 128e top4 +1shared GQA Hunyuan Hunyuan 3 · 296.3 B · 192e top8 +1shared GQA Kimi Kimi K3 · 2780 B · 896e top16 +2shared MLA GLM GLM-5.3 · 767.4 B · 256e top8 +1shared MLA GLM GLM-5.3-Flash · 328.9 B · 288e top8 +1shared MLA Hunyuan Hunyuan 4 Preview · 770 B · 256e top8 +1shared MLA Qwen Qwen3.8 2.4T A95B · 2399.6 B · 512e top10 +1shared GQA Qwen Qwen3.8 27B · 23.7 B GQA Qwen Qwen3.8-Flash-Next · 123.6 B · 512e top10 +1shared GQA