開源大語言模型的結構解剖 · GPT-2 → 2026
開源大模型的結構解剖
本圖譜對 2019 年 GPT-2 至 2026 年間發布的 80 個開源大語言模型做結構解剖。這裡不記錄跑分,只記錄結構:注意力如何從多頭(MHA)演進到分組查詢(GQA)、多頭潛在(MLA)與混合線性設計;稀疏混合專家如何取代稠密前饋層;各家實驗室在何時採用了哪些算子。每一個數字都可溯源到隨模型發布的公開 config.json 或原始論文。
80個模型
10實驗室
55稀疏 MoE
2019–2026發布時間
同一套語料的九種打開方式——依你的問題選擇視角。
模型索引
80 個開源大模型架構的可排序索引:總參數、激活參數、上下文長度、注意力變體、MoE 佈局、層數與注意力頭。
架構演進
LLM 注意力如何從 MHA 走向 MQA、GQA、MLA 與混合線性設計;各算子的採用時間線與首個開源採用者。
算子拆解
語料中的每個架構算子——注意力、MoE、正規化、位置編碼與推理側——給出機制、採用數量、首個開源採用者與證據出處。
時間線
2019–2026 年 80 個開源大模型發布時間圖:橫軸為發布日期,縱軸為總參數(對數刻度),依實驗室著色。
流派譜系
依實驗室歸組的模型譜系:OpenAI、Meta、Mistral、DeepSeek、Qwen、GLM、Kimi、MiniMax、StepFun 與騰訊混元。
結構相似度
基於架構特徵向量的餘弦相似度:注意力類別、MoE 佈局、正規化、位置編碼、規模與上下文。
論文溯源
圖譜中每項技術的原始論文:Transformer、GQA、MLA、RoPE、YaRN、RMSNorm、SwiGLU、Mixtral、DeepSeek-V2/V3 等。
多模態
語料中具備視覺能力的模型:以公開 config.json 中客觀存在的視覺欄位為判定依據。
比較
最多選擇四個大模型架構並排比較:注意力、MoE 佈局、層數、上下文、訓練精度等。
全景圖
80 個模型盡收一圖:發布日期對總參數(對數刻度),依實驗室著色。
模型牆
圖譜中的每個模型一張卡片:實驗室、日期、參數量、注意力類別與 MoE 佈局一目了然。
設定溯源
瀏覽 80 個開源模型完整的公開 config.json:全部欄位,可搜尋、可複製。
架構測驗
檢驗你對大模型架構的了解:注意力變體、MoE 佈局、實驗室與規模——題目由圖譜語料生成。