开源大语言模型的结构解剖 · GPT-2 → 2026

开源大模型的结构解剖

本图谱对 2019 年 GPT-2 至 2026 年间发布的 80 个开源大语言模型做结构解剖。这里不记录跑分,只记录结构:注意力如何从多头(MHA)演进到分组查询(GQA)、多头潜在(MLA)与混合线性设计;稀疏混合专家如何取代稠密前馈层;各家实验室在何时采用了哪些算子。每一个数字都可溯源到随模型发布的公开 config.json 或原始论文。

80个模型
10实验室
55稀疏 MoE
2019–2026发布时间

同一套语料的九种打开方式——按你的问题选择视角。

模型索引 80 个开源大模型架构的可排序索引:总参数、激活参数、上下文长度、注意力变体、MoE 布局、层数与注意力头。 架构演进 LLM 注意力如何从 MHA 走向 MQA、GQA、MLA 与混合线性设计;各算子的采用时间线与首个开源采用者。 算子拆解 语料中的每个架构算子——注意力、MoE、归一化、位置编码与推理侧——给出机制、采用数量、首个开源采用者与证据出处。 时间线 2019–2026 年 80 个开源大模型发布时间图:横轴为发布日期,纵轴为总参数(对数刻度),按实验室着色。 流派谱系 按实验室归组的模型谱系:OpenAI、Meta、Mistral、DeepSeek、Qwen、GLM、Kimi、MiniMax、StepFun 与腾讯混元。 结构相似度 基于架构特征向量的余弦相似度:注意力类别、MoE 布局、归一化、位置编码、规模与上下文。 论文溯源 图谱中每项技术的原始论文:Transformer、GQA、MLA、RoPE、YaRN、RMSNorm、SwiGLU、Mixtral、DeepSeek-V2/V3 等。 多模态 语料中具备视觉能力的模型:以公开 config.json 中客观存在的视觉字段为判定依据。 对比 最多选择四个大模型架构并排对比:注意力、MoE 布局、层数、上下文、训练精度等。 全景图 80 个模型尽收一图:发布日期对总参数(对数刻度),按实验室着色。 模型墙 图谱中的每个模型一张卡片:实验室、日期、参数量、注意力类别与 MoE 布局一目了然。 配置溯源 浏览 80 个开源模型完整的公开 config.json:全部字段,可搜索、可复制。 架构测验 检验你对大模型架构的了解:注意力变体、MoE 布局、实验室与规模——题目由图谱语料生成。

总参数 · 激活参数

1000B Kimi K3 Qwen3.8 2.4T A95B DeepSeek-V4-Pro Kimi K2 Base Kimi K2 0905 Kimi K2.5 Kimi K2.6 Hunyuan 4 Preview GLM-5.2 GLM-5.3 GLM-5 GLM-5.1 DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 DeepSeek-V3.1 DeepSeek-V3.2 MiniMax-Text-01 总参数 激活参数
规模最大的开源模型:灰条为总参数(对数刻度),红条为每 token 激活参数占总参数的比例。 · log₁₀