算子級拆解

本頁把語料逐個算子拆開:它做什麼、語料中有多少模型在用、誰最先在開源權重裡用上、證據在哪裡——精確到 config.json 欄位名,存在原始論文的一併給出。

注意力算子

算子機制與意義模型首個開源採用者證據
MHA 每個查詢頭獨享一組 key/value 頭:表達能力完整,KV 快取最大。 10 GPT-2 (2019-02) num_attention_heads = num_key_value_heads · arXiv:1706.03762
GQA 查詢頭按小組共享 KV 頭:以極小的快取代價保留 MHA 的大部分品質。 46 Llama 2 70B (2023-07) num_key_value_heads < num_attention_heads · arXiv:2305.13245
MQA 所有查詢頭共享唯一一組 KV 頭:快取最小,品質略有折損。 3 DeepSeek-V4-Flash (2026-04) num_key_value_heads = 1 · arXiv:1911.02150
MLA key/value 被投影到低秩潛在向量,外加一小支解耦的 RoPE 鍵;快取縮小一個數量級。 21 DeepSeek-V2 (2024-05) kv_lora_rank · arXiv:2405.04434
SWA 每個 token 只在最近的滑動視窗內做注意力:快取與算力隨上下文線性增長。 12 Mistral 7B (2023-09) sliding_window · arXiv:2310.06825
Linear attention (hybrid) 循環式線性注意力層(近恆定記憶體)之間插入少量全注意力層。 0 linear_attn_config / layer types

前饋與 MoE

算子機制與意義模型首個開源採用者證據
MoE 前饋層被替換為大量專家網路,路由器為每個 token 激活 top-k 個:容量與算力解耦。 55 DeepSeekMoE 16B (2024-01) n_routed_experts · num_experts_per_tok · arXiv:2401.06066
SwiGLU / SiLU 帶 SiLU 閘的線性單元:單位參數品質優於普通 GELU/ReLU 前饋塊。 70 LLaMA 1 7B (2023-02) hidden_act = silu · arXiv:2002.05202

正規化與位置

算子機制與意義模型首個開源採用者證據
RMSNorm 僅按均方根正規化(不去均值):更便宜,大規模下更穩定。 73 LLaMA 1 7B (2023-02) rms_norm_eps · arXiv:1910.07467
RoPE 旋轉 Q/K 對來編碼相對位置:隨上下文自然外推。 58 Mistral 7B (2023-09) rope_theta · arXiv:2104.09864
YaRN long-context 重縮放 RoPE 頻譜,把上下文視窗拉伸到遠超預訓練長度。 0 rope_scaling.rope_type = yarn · arXiv:2309.00071

推理與精度

算子機制與意義模型首個開源採用者證據
Multi-Token Prediction 額外的輕量頭在單次前向中預測多個未來 token,加速解碼。 39 DeepSeek-V3 (2024-12) num_nextn_predict_layers · arXiv:2412.19437
FP8 training 權重與激活採用 8 位浮點:記憶體約省一半,前沿規模下矩陣乘法更快。 18 DeepSeek-V3 (2024-12) torch_dtype / quantization_config

口徑說明

是否採用由 config.json 機械判定(證據欄給出精確欄位名)。「首個採用者」指本語料中最早攜帶該算子的開源權重版本;更早的非開源先例見「論文溯源」頁。