تطور المعمارية
الأساليب المعمارية لا تظهر عشوائياً: بل تنتشر من معمل إلى آخر. تتبع هذه الصفحة منحنيين: تطور الانتباه نفسه، والجدول الزمني لتبنّي العمليات التي جعلت النماذج الحديثة قابلة للتدريب ورخيصة الاستدلال.
الانتباه: من MHA إلى الخطي الهجين
يحسب الانتباه متعدد الرؤوس (MHA) مجموعة رؤوس مفتاح–قيمة لكل رأس استعلام. يشارك الانتباه متعدد الاستعلامات (MQA) رأس KV واحداً بين جميع الاستعلامات؛ ويعمّم الانتباه المجمّع (GQA) ذلك على عدد قليل من الرؤوس المشتركة وأصبح الخيار الافتراضي للنماذج المكثفة بعد Llama 2 70B. أما الانتباه الكامن متعدد الرؤوس (MLA)، الذي قُدّم مع DeepSeek-V2، فيضغط المفاتيح والقيم في متجه كامن منخفض الرتبة. وأحدث التصاميم الهجينة تمزج طبقات انتباه خطي مع أقلية من طبقات الانتباه الكامل.
انتباه متعدد الرؤوس (MHA) · 10
الصيغة الأصلية: مجموعة رؤوس مفتاح–قيمة لكل رأس استعلام. المعيار من GPT-2 حتى معظم النماذج المكثفة قبل 2023.
GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash
انتباه متعدد الاستعلامات (MQA) · 3
رأس KV واحد مشترك يخدم جميع رؤوس الاستعلام — توفير كبير لذاكرة KV مقابل خسارة في الجودة؛ نادر في النماذج المفتوحة الرائدة.
انتباه الاستعلامات المجمّعة (GQA) · 46
رؤوس KV قليلة تُشارَك بين مجموعات من رؤوس الاستعلام. المعيار للنماذج المفتوحة المكثفة منذ Llama 2 70B.
Llama 2 70B Mistral 7B ChatGLM3 6B Mixtral 8x22B GLM-4 9B Qwen2 72B Llama 3.1 70B Llama 3.1 8B Qwen2.5 72B Qwen2.5 7B MiniMax-Text-01 Qwen3 0.6B Qwen3 235B A22B Qwen3 30B A3B Qwen3 32B Qwen3 8B MiniMax-M1 GLM-4.5 GLM-4.5-Air Hunyuan 7B GPT-OSS 120B GPT-OSS 20B Qwen3-Next 80B A3B GLM-4.6 MiniMax-M2 Qwen3-Coder-Next MiniMax-M2.5 Qwen3.5 122B A10B Qwen3.5 27B Qwen3.5 35B A3B Qwen3.5 397B A17B Qwen3.5 9B Qwen3.5 9B Base Hunyuan 3 Preview Hunyuan 3 Preview Base MiniMax-M2.7 Qwen3.6 27B Qwen3.6 35B A3B Hunyuan-TurboS 30B A3B Hunyuan-TurboS 7B MiniMax-M3 MiniMax-M3 MXFP8 Hunyuan 3 Qwen3.8 2.4T A95B Qwen3.8 27B Qwen3.8-Flash-Next
انتباه كامن متعدد الرؤوس (MLA) · 21
تُضغط المفاتيح والقيم في متجه كامن منخفض الرتبة، ما يقلص ذاكرة KV بشكل كبير؛ قُدّمت مع DeepSeek-V2.
DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview
انتباه خطي هجين · 0
أقلية من طبقات الانتباه الكامل تتخللها طبقات انتباه خطي، مقايضةً كلفة السياق الطويل بذاكرة شبه ثابتة.
تبنّي العمليات
كل صف هو أسلوب تقني؛ والسنة المذكورة هي أول استخدام مفتوح الأوزان له في المجموعة.
| الانتباه / الموضوع | النموذج | أول متبنٍّ مفتوح الأوزان |
|---|---|---|
| MHA | 10 | GPT-2 (2019-02) |
| GQA | 46 | Llama 2 70B (2023-07) |
| MLA | 21 | DeepSeek-V2 (2024-05) |
| MQA | 3 | DeepSeek-V4-Flash (2026-04) |
| SWA | 12 | Mistral 7B (2023-09) |
| Linear attention (hybrid) | 0 | — |
| MoE | 55 | DeepSeekMoE 16B (2024-01) |
| RoPE | 58 | Mistral 7B (2023-09) |
| YaRN long-context | 0 | — |
| RMSNorm | 73 | LLaMA 1 7B (2023-02) |
| SwiGLU / SiLU | 70 | LLaMA 1 7B (2023-02) |
| Multi-Token Prediction | 39 | DeepSeek-V3 (2024-12) |
| FP8 training | 18 | DeepSeek-V3 (2024-12) |