开源大语言模型的结构解剖 · GPT-2 → 2026
开源大模型的结构解剖
本图谱对 2019 年 GPT-2 至 2026 年间发布的 80 个开源大语言模型做结构解剖。这里不记录跑分,只记录结构:注意力如何从多头(MHA)演进到分组查询(GQA)、多头潜在(MLA)与混合线性设计;稀疏混合专家如何取代稠密前馈层;各家实验室在何时采用了哪些算子。每一个数字都可溯源到随模型发布的公开 config.json 或原始论文。
80个模型
10实验室
55稀疏 MoE
2019–2026发布时间
同一套语料的九种打开方式——按你的问题选择视角。
模型索引
80 个开源大模型架构的可排序索引:总参数、激活参数、上下文长度、注意力变体、MoE 布局、层数与注意力头。
架构演进
LLM 注意力如何从 MHA 走向 MQA、GQA、MLA 与混合线性设计;各算子的采用时间线与首个开源采用者。
算子拆解
语料中的每个架构算子——注意力、MoE、归一化、位置编码与推理侧——给出机制、采用数量、首个开源采用者与证据出处。
时间线
2019–2026 年 80 个开源大模型发布时间图:横轴为发布日期,纵轴为总参数(对数刻度),按实验室着色。
流派谱系
按实验室归组的模型谱系:OpenAI、Meta、Mistral、DeepSeek、Qwen、GLM、Kimi、MiniMax、StepFun 与腾讯混元。
结构相似度
基于架构特征向量的余弦相似度:注意力类别、MoE 布局、归一化、位置编码、规模与上下文。
论文溯源
图谱中每项技术的原始论文:Transformer、GQA、MLA、RoPE、YaRN、RMSNorm、SwiGLU、Mixtral、DeepSeek-V2/V3 等。
多模态
语料中具备视觉能力的模型:以公开 config.json 中客观存在的视觉字段为判定依据。
对比
最多选择四个大模型架构并排对比:注意力、MoE 布局、层数、上下文、训练精度等。
全景图
80 个模型尽收一图:发布日期对总参数(对数刻度),按实验室着色。
模型墙
图谱中的每个模型一张卡片:实验室、日期、参数量、注意力类别与 MoE 布局一目了然。
配置溯源
浏览 80 个开源模型完整的公开 config.json:全部字段,可搜索、可复制。
架构测验
检验你对大模型架构的了解:注意力变体、MoE 布局、实验室与规模——题目由图谱语料生成。