算子级拆解
本页把语料逐个算子拆开:它做什么、语料中有多少模型在用、谁最先在开源权重里用上、证据在哪里——精确到 config.json 字段名,存在原始论文的一并给出。
注意力算子
| 算子 | 机制与意义 | 模型 | 首个开源采用者 | 证据 |
|---|---|---|---|---|
| MHA | 每个查询头独享一组 key/value 头:表达能力完整,KV 缓存最大。 | 10 | GPT-2 (2019-02) | num_attention_heads = num_key_value_heads · arXiv:1706.03762 |
| GQA | 查询头按小组共享 KV 头:以极小的缓存代价保留 MHA 的大部分质量。 | 46 | Llama 2 70B (2023-07) | num_key_value_heads < num_attention_heads · arXiv:2305.13245 |
| MQA | 所有查询头共享唯一一组 KV 头:缓存最小,质量略有折损。 | 3 | DeepSeek-V4-Flash (2026-04) | num_key_value_heads = 1 · arXiv:1911.02150 |
| MLA | key/value 被投影到低秩潜在向量,外加一小支解耦的 RoPE 键;缓存缩小一个数量级。 | 21 | DeepSeek-V2 (2024-05) | kv_lora_rank · arXiv:2405.04434 |
| SWA | 每个 token 只在最近的滑动窗口内做注意力:缓存与算力随上下文线性增长。 | 12 | Mistral 7B (2023-09) | sliding_window · arXiv:2310.06825 |
| Linear attention (hybrid) | 循环式线性注意力层(近恒定显存)之间插入少量全注意力层。 | 0 | — | linear_attn_config / layer types |
前馈与 MoE
| 算子 | 机制与意义 | 模型 | 首个开源采用者 | 证据 |
|---|---|---|---|---|
| MoE | 前馈层被替换为大量专家网络,路由器为每个 token 激活 top-k 个:容量与算力解耦。 | 55 | DeepSeekMoE 16B (2024-01) | n_routed_experts · num_experts_per_tok · arXiv:2401.06066 |
| SwiGLU / SiLU | 带 SiLU 门的线性单元:单位参数质量优于普通 GELU/ReLU 前馈块。 | 70 | LLaMA 1 7B (2023-02) | hidden_act = silu · arXiv:2002.05202 |
归一化与位置
| 算子 | 机制与意义 | 模型 | 首个开源采用者 | 证据 |
|---|---|---|---|---|
| RMSNorm | 仅按均方根归一化(不去均值):更便宜,大规模下更稳定。 | 73 | LLaMA 1 7B (2023-02) | rms_norm_eps · arXiv:1910.07467 |
| RoPE | 旋转 Q/K 对来编码相对位置:随上下文自然外推。 | 58 | Mistral 7B (2023-09) | rope_theta · arXiv:2104.09864 |
| YaRN long-context | 重缩放 RoPE 频谱,把上下文窗口拉伸到远超预训练长度。 | 0 | — | rope_scaling.rope_type = yarn · arXiv:2309.00071 |
推理与精度
| 算子 | 机制与意义 | 模型 | 首个开源采用者 | 证据 |
|---|---|---|---|---|
| Multi-Token Prediction | 额外的轻量头在单次前向中预测多个未来 token,加速解码。 | 39 | DeepSeek-V3 (2024-12) | num_nextn_predict_layers · arXiv:2412.19437 |
| FP8 training | 权重与激活采用 8 位浮点:显存约省一半,前沿规模下矩阵乘法更快。 | 18 | DeepSeek-V3 (2024-12) | torch_dtype / quantization_config |
口径说明
是否采用由 config.json 机械判定(证据列给出精确字段名)。「首个采用者」指本语料中最早携带该算子的开源权重版本;更早的非开源先例见「论文溯源」页。