架构演进

架构技术不是凭空出现的,它在实验室之间逐家扩散。本页呈现两条线索:注意力本身的演进,以及让现代大模型可训练、可廉价推理的算子采用时间线。

注意力:从 MHA 到混合线性

多头注意力(MHA)为每个查询头计算一组 key–value。多查询注意力(MQA)让所有查询共享单个 KV 头;分组查询注意力(GQA)将其推广为少数共享头,自 Llama 2 70B 之后成为稠密模型的默认选择。多头潜在注意力(MLA)随 DeepSeek-V2 提出,把 key 与 value 压缩进低秩潜在向量。最新的混合设计则以线性注意力层为主,仅保留少量全注意力层。

多头注意力(MHA) · 10

最初的形式:每个查询头配一组 key–value 头。从 GPT-2 到 2023 年前的大多数稠密模型均如此。

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

多查询注意力(MQA) · 3

所有查询头共享单个 KV 头——以一定质量代价换取极致的 KV 缓存节省;在前沿开源模型中已少见。

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1
Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

混合线性注意力 · 0

以线性注意力层为主、间以少量全注意力层,用接近恒定的显存换取长上下文能力。

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full 线性注意力层之间插入少量全注意力层

算子采用

每行是一项技术,年份为语料中最早的模型在开源版本里使用它的时间。

注意力 / 主题模型首个开源采用者
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)