算子級拆解
本頁把語料逐個算子拆開:它做什麼、語料中有多少模型在用、誰最先在開源權重裡用上、證據在哪裡——精確到 config.json 欄位名,存在原始論文的一併給出。
注意力算子
| 算子 | 機制與意義 | 模型 | 首個開源採用者 | 證據 |
|---|---|---|---|---|
| MHA | 每個查詢頭獨享一組 key/value 頭:表達能力完整,KV 快取最大。 | 10 | GPT-2 (2019-02) | num_attention_heads = num_key_value_heads · arXiv:1706.03762 |
| GQA | 查詢頭按小組共享 KV 頭:以極小的快取代價保留 MHA 的大部分品質。 | 46 | Llama 2 70B (2023-07) | num_key_value_heads < num_attention_heads · arXiv:2305.13245 |
| MQA | 所有查詢頭共享唯一一組 KV 頭:快取最小,品質略有折損。 | 3 | DeepSeek-V4-Flash (2026-04) | num_key_value_heads = 1 · arXiv:1911.02150 |
| MLA | key/value 被投影到低秩潛在向量,外加一小支解耦的 RoPE 鍵;快取縮小一個數量級。 | 21 | DeepSeek-V2 (2024-05) | kv_lora_rank · arXiv:2405.04434 |
| SWA | 每個 token 只在最近的滑動視窗內做注意力:快取與算力隨上下文線性增長。 | 12 | Mistral 7B (2023-09) | sliding_window · arXiv:2310.06825 |
| Linear attention (hybrid) | 循環式線性注意力層(近恆定記憶體)之間插入少量全注意力層。 | 0 | — | linear_attn_config / layer types |
前饋與 MoE
| 算子 | 機制與意義 | 模型 | 首個開源採用者 | 證據 |
|---|---|---|---|---|
| MoE | 前饋層被替換為大量專家網路,路由器為每個 token 激活 top-k 個:容量與算力解耦。 | 55 | DeepSeekMoE 16B (2024-01) | n_routed_experts · num_experts_per_tok · arXiv:2401.06066 |
| SwiGLU / SiLU | 帶 SiLU 閘的線性單元:單位參數品質優於普通 GELU/ReLU 前饋塊。 | 70 | LLaMA 1 7B (2023-02) | hidden_act = silu · arXiv:2002.05202 |
正規化與位置
| 算子 | 機制與意義 | 模型 | 首個開源採用者 | 證據 |
|---|---|---|---|---|
| RMSNorm | 僅按均方根正規化(不去均值):更便宜,大規模下更穩定。 | 73 | LLaMA 1 7B (2023-02) | rms_norm_eps · arXiv:1910.07467 |
| RoPE | 旋轉 Q/K 對來編碼相對位置:隨上下文自然外推。 | 58 | Mistral 7B (2023-09) | rope_theta · arXiv:2104.09864 |
| YaRN long-context | 重縮放 RoPE 頻譜,把上下文視窗拉伸到遠超預訓練長度。 | 0 | — | rope_scaling.rope_type = yarn · arXiv:2309.00071 |
推理與精度
| 算子 | 機制與意義 | 模型 | 首個開源採用者 | 證據 |
|---|---|---|---|---|
| Multi-Token Prediction | 額外的輕量頭在單次前向中預測多個未來 token,加速解碼。 | 39 | DeepSeek-V3 (2024-12) | num_nextn_predict_layers · arXiv:2412.19437 |
| FP8 training | 權重與激活採用 8 位浮點:記憶體約省一半,前沿規模下矩陣乘法更快。 | 18 | DeepSeek-V3 (2024-12) | torch_dtype / quantization_config |
口徑說明
是否採用由 config.json 機械判定(證據欄給出精確欄位名)。「首個採用者」指本語料中最早攜帶該算子的開源權重版本;更早的非開源先例見「論文溯源」頁。