架構演進

架構技術不是憑空出現的,它在實驗室之間逐家擴散。本頁呈現兩條線索:注意力本身的演進,以及讓現代大模型可訓練、可廉價推論的算子採用時間線。

注意力:從 MHA 到混合線性

多頭注意力(MHA)為每個查詢頭計算一組 key–value。多查詢注意力(MQA)讓所有查詢共享單一 KV 頭;分組查詢注意力(GQA)將其推廣為少數共享頭,自 Llama 2 70B 之後成為稠密模型的預設選擇。多頭潛在注意力(MLA)隨 DeepSeek-V2 提出,把 key 與 value 壓縮進低秩潛在向量。最新的混合設計則以線性注意力層為主,僅保留少量全注意力層。

多頭注意力(MHA) · 10

最初的形式:每個查詢頭配一組 key–value 頭。從 GPT-2 到 2023 年前的大多數稠密模型皆如此。

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

多查詢注意力(MQA) · 3

所有查詢頭共享單一 KV 頭——以一定品質代價換取極致的 KV 快取節省;在前沿開源模型中已少見。

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1
Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

混合線性注意力 · 0

以線性注意力層為主、間以少量全注意力層,用接近恆定的記憶體換取長上下文能力。

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full 線性注意力層之間插入少量全注意力層

算子採用

每行是一項技術,年份為語料中最早的模型在開源版本裡使用它的時間。

注意力 / 主題模型首個開源採用者
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)