算子级拆解

本页把语料逐个算子拆开:它做什么、语料中有多少模型在用、谁最先在开源权重里用上、证据在哪里——精确到 config.json 字段名,存在原始论文的一并给出。

注意力算子

算子机制与意义模型首个开源采用者证据
MHA 每个查询头独享一组 key/value 头:表达能力完整,KV 缓存最大。 10 GPT-2 (2019-02) num_attention_heads = num_key_value_heads · arXiv:1706.03762
GQA 查询头按小组共享 KV 头:以极小的缓存代价保留 MHA 的大部分质量。 46 Llama 2 70B (2023-07) num_key_value_heads < num_attention_heads · arXiv:2305.13245
MQA 所有查询头共享唯一一组 KV 头:缓存最小,质量略有折损。 3 DeepSeek-V4-Flash (2026-04) num_key_value_heads = 1 · arXiv:1911.02150
MLA key/value 被投影到低秩潜在向量,外加一小支解耦的 RoPE 键;缓存缩小一个数量级。 21 DeepSeek-V2 (2024-05) kv_lora_rank · arXiv:2405.04434
SWA 每个 token 只在最近的滑动窗口内做注意力:缓存与算力随上下文线性增长。 12 Mistral 7B (2023-09) sliding_window · arXiv:2310.06825
Linear attention (hybrid) 循环式线性注意力层(近恒定显存)之间插入少量全注意力层。 0 linear_attn_config / layer types

前馈与 MoE

算子机制与意义模型首个开源采用者证据
MoE 前馈层被替换为大量专家网络,路由器为每个 token 激活 top-k 个:容量与算力解耦。 55 DeepSeekMoE 16B (2024-01) n_routed_experts · num_experts_per_tok · arXiv:2401.06066
SwiGLU / SiLU 带 SiLU 门的线性单元:单位参数质量优于普通 GELU/ReLU 前馈块。 70 LLaMA 1 7B (2023-02) hidden_act = silu · arXiv:2002.05202

归一化与位置

算子机制与意义模型首个开源采用者证据
RMSNorm 仅按均方根归一化(不去均值):更便宜,大规模下更稳定。 73 LLaMA 1 7B (2023-02) rms_norm_eps · arXiv:1910.07467
RoPE 旋转 Q/K 对来编码相对位置:随上下文自然外推。 58 Mistral 7B (2023-09) rope_theta · arXiv:2104.09864
YaRN long-context 重缩放 RoPE 频谱,把上下文窗口拉伸到远超预训练长度。 0 rope_scaling.rope_type = yarn · arXiv:2309.00071

推理与精度

算子机制与意义模型首个开源采用者证据
Multi-Token Prediction 额外的轻量头在单次前向中预测多个未来 token,加速解码。 39 DeepSeek-V3 (2024-12) num_nextn_predict_layers · arXiv:2412.19437
FP8 training 权重与激活采用 8 位浮点:显存约省一半,前沿规模下矩阵乘法更快。 18 DeepSeek-V3 (2024-12) torch_dtype / quantization_config

口径说明

是否采用由 config.json 机械判定(证据列给出精确字段名)。「首个采用者」指本语料中最早携带该算子的开源权重版本;更早的非开源先例见「论文溯源」页。