تفكيك على مستوى العمليات
تفكك هذه الصفحة المجموعة عمليةً عملية: ماذا تفعل كل عملية، وكم نموذجاً يستخدمها، ومن أول من قدمها بأوزان مفتوحة، وأين الدليل — الحقل الدقيق في config.json، والورقة الأصلية إن وُجدت.
عمليات الانتباه
| العملية | الآلية والمعنى | النموذج | أول متبنٍّ مفتوح الأوزان | الدليل |
|---|---|---|---|---|
| MHA | لكل رأس استعلام مجموعة key/value خاصة: تعبير كامل وأكبر ذاكرة KV. | 10 | GPT-2 (2019-02) | num_attention_heads = num_key_value_heads · arXiv:1706.03762 |
| GQA | تتشارك رؤوس الاستعلام رؤوس KV في مجموعات صغيرة — معظم جودة MHA بجزء بسيط من الذاكرة. | 46 | Llama 2 70B (2023-07) | num_key_value_heads < num_attention_heads · arXiv:2305.13245 |
| MQA | تتشارك كل رؤوس الاستعلام رأس KV واحداً: أدنى ذاكرة مع خسارة بسيطة في الجودة. | 3 | DeepSeek-V4-Flash (2026-04) | num_key_value_heads = 1 · arXiv:1911.02150 |
| MLA | تُسقط المفاتيح/القيم إلى متجه كامن منخفض الرتبة مع مفتاح RoPE صغير منفصل؛ تتقلص الذاكرة بمرتبة من الحجم. | 21 | DeepSeek-V2 (2024-05) | kv_lora_rank · arXiv:2405.04434 |
| SWA | ينتبه كل رمز داخل نافذة منزلقة حديثة فقط؛ تنمو الذاكرة والتكلفة خطياً مع السياق. | 12 | Mistral 7B (2023-09) | sliding_window · arXiv:2310.06825 |
| Linear attention (hybrid) | طبقات انتباه خطي متكررة بذاكرة شبه ثابتة تتخللها أقلية من طبقات الانتباه الكامل. | 0 | — | linear_attn_config / layer types |
التغذية الأمامية وMoE
| العملية | الآلية والمعنى | النموذج | أول متبنٍّ مفتوح الأوزان | الدليل |
|---|---|---|---|---|
| MoE | تتحول الشبكة التغذية إلى شبكة خبراء كثيرة؛ يوجّه الموجِّه top-k لكل رمز، فيفصل السعة عن الحساب. | 55 | DeepSeekMoE 16B (2024-01) | n_routed_experts · num_experts_per_tok · arXiv:2401.06066 |
| SwiGLU / SiLU | وحدات خطية موجهة بـ SiLU — جودة أعلى لكل معامل من كتل GELU/ReLU البسيطة. | 70 | LLaMA 1 7B (2023-02) | hidden_act = silu · arXiv:2002.05202 |
التطبيع والموضع
| العملية | الآلية والمعنى | النموذج | أول متبنٍّ مفتوح الأوزان | الدليل |
|---|---|---|---|---|
| RMSNorm | تطبيع بالجذر التربيعي للمتوسط دون تمركز المتوسط: أرخص ومستقر على النطاقات الكبيرة. | 73 | LLaMA 1 7B (2023-02) | rms_norm_eps · arXiv:1910.07467 |
| RoPE | يرمز للموضع النسبي بتدوير أزواج Q/K؛ ويستقر خارجياً مع السياق بطبيعة الحال. | 58 | Mistral 7B (2023-09) | rope_theta · arXiv:2104.09864 |
| YaRN long-context | يعيد قياس طيف ترددات RoPE لمد نافذة السياق إلى ما هو أبعد من طول التدريب المسبق بكثير. | 0 | — | rope_scaling.rope_type = yarn · arXiv:2309.00071 |
الاستدلال والدقة
| العملية | الآلية والمعنى | النموذج | أول متبنٍّ مفتوح الأوزان | الدليل |
|---|---|---|---|---|
| Multi-Token Prediction | رؤوس إضافية خفيفة تتنبأ بعدة رموز مستقبلية في كل تمريرة وتسرّع فك الترميز. | 39 | DeepSeek-V3 (2024-12) | num_nextn_predict_layers · arXiv:2412.19437 |
| FP8 training | أوزان وتنشيطات بفاصلة عائمة 8 بت: نحو نصف الذاكرة وضرب مصفوفات أسرع في الأنطاقات القصوى. | 18 | DeepSeek-V3 (2024-12) | torch_dtype / quantization_config |
ملاحظة المنهجية
يُقرر التبني آلياً من config.json المرفق (عمود الدليل يسمي الحقول الدقيقة). «أول متبنٍّ» أقدم إصدار مفتوح الأوزان في المجموعة؛ والسوابق غير المفتوحة في صفحة الأوراق.