تطور المعمارية

الأساليب المعمارية لا تظهر عشوائياً: بل تنتشر من معمل إلى آخر. تتبع هذه الصفحة منحنيين: تطور الانتباه نفسه، والجدول الزمني لتبنّي العمليات التي جعلت النماذج الحديثة قابلة للتدريب ورخيصة الاستدلال.

الانتباه: من MHA إلى الخطي الهجين

يحسب الانتباه متعدد الرؤوس (MHA) مجموعة رؤوس مفتاح–قيمة لكل رأس استعلام. يشارك الانتباه متعدد الاستعلامات (MQA) رأس KV واحداً بين جميع الاستعلامات؛ ويعمّم الانتباه المجمّع (GQA) ذلك على عدد قليل من الرؤوس المشتركة وأصبح الخيار الافتراضي للنماذج المكثفة بعد Llama 2 70B. أما الانتباه الكامن متعدد الرؤوس (MLA)، الذي قُدّم مع DeepSeek-V2، فيضغط المفاتيح والقيم في متجه كامن منخفض الرتبة. وأحدث التصاميم الهجينة تمزج طبقات انتباه خطي مع أقلية من طبقات الانتباه الكامل.

انتباه متعدد الرؤوس (MHA) · 10

الصيغة الأصلية: مجموعة رؤوس مفتاح–قيمة لكل رأس استعلام. المعيار من GPT-2 حتى معظم النماذج المكثفة قبل 2023.

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

انتباه متعدد الاستعلامات (MQA) · 3

رأس KV واحد مشترك يخدم جميع رؤوس الاستعلام — توفير كبير لذاكرة KV مقابل خسارة في الجودة؛ نادر في النماذج المفتوحة الرائدة.

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1

انتباه كامن متعدد الرؤوس (MLA) · 21

تُضغط المفاتيح والقيم في متجه كامن منخفض الرتبة، ما يقلص ذاكرة KV بشكل كبير؛ قُدّمت مع DeepSeek-V2.

DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview

Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

انتباه خطي هجين · 0

أقلية من طبقات الانتباه الكامل تتخللها طبقات انتباه خطي، مقايضةً كلفة السياق الطويل بذاكرة شبه ثابتة.

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full طبقات انتباه خطي تتخللها طبقات قليلة من الانتباه الكامل

تبنّي العمليات

كل صف هو أسلوب تقني؛ والسنة المذكورة هي أول استخدام مفتوح الأوزان له في المجموعة.

الانتباه / الموضوعالنموذجأول متبنٍّ مفتوح الأوزان
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)