開源大語言模型的結構解剖 · GPT-2 → 2026

開源大模型的結構解剖

本圖譜對 2019 年 GPT-2 至 2026 年間發布的 80 個開源大語言模型做結構解剖。這裡不記錄跑分,只記錄結構:注意力如何從多頭(MHA)演進到分組查詢(GQA)、多頭潛在(MLA)與混合線性設計;稀疏混合專家如何取代稠密前饋層;各家實驗室在何時採用了哪些算子。每一個數字都可溯源到隨模型發布的公開 config.json 或原始論文。

80個模型
10實驗室
55稀疏 MoE
2019–2026發布時間

同一套語料的九種打開方式——依你的問題選擇視角。

模型索引 80 個開源大模型架構的可排序索引:總參數、激活參數、上下文長度、注意力變體、MoE 佈局、層數與注意力頭。 架構演進 LLM 注意力如何從 MHA 走向 MQA、GQA、MLA 與混合線性設計;各算子的採用時間線與首個開源採用者。 算子拆解 語料中的每個架構算子——注意力、MoE、正規化、位置編碼與推理側——給出機制、採用數量、首個開源採用者與證據出處。 時間線 2019–2026 年 80 個開源大模型發布時間圖:橫軸為發布日期,縱軸為總參數(對數刻度),依實驗室著色。 流派譜系 依實驗室歸組的模型譜系:OpenAI、Meta、Mistral、DeepSeek、Qwen、GLM、Kimi、MiniMax、StepFun 與騰訊混元。 結構相似度 基於架構特徵向量的餘弦相似度:注意力類別、MoE 佈局、正規化、位置編碼、規模與上下文。 論文溯源 圖譜中每項技術的原始論文:Transformer、GQA、MLA、RoPE、YaRN、RMSNorm、SwiGLU、Mixtral、DeepSeek-V2/V3 等。 多模態 語料中具備視覺能力的模型:以公開 config.json 中客觀存在的視覺欄位為判定依據。 比較 最多選擇四個大模型架構並排比較:注意力、MoE 佈局、層數、上下文、訓練精度等。 全景圖 80 個模型盡收一圖:發布日期對總參數(對數刻度),依實驗室著色。 模型牆 圖譜中的每個模型一張卡片:實驗室、日期、參數量、注意力類別與 MoE 佈局一目了然。 設定溯源 瀏覽 80 個開源模型完整的公開 config.json:全部欄位,可搜尋、可複製。 架構測驗 檢驗你對大模型架構的了解:注意力變體、MoE 佈局、實驗室與規模——題目由圖譜語料生成。

總參數 · 激活參數

1000B Kimi K3 Qwen3.8 2.4T A95B DeepSeek-V4-Pro Kimi K2 Base Kimi K2 0905 Kimi K2.5 Kimi K2.6 Hunyuan 4 Preview GLM-5.2 GLM-5.3 GLM-5 GLM-5.1 DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 DeepSeek-V3.1 DeepSeek-V3.2 MiniMax-Text-01 總參數 激活參數
規模最大的開源模型:灰條為總參數(對數刻度),紅條為每 token 激活參數佔總參數的比例。 · log₁₀