تفكيك على مستوى العمليات

تفكك هذه الصفحة المجموعة عمليةً عملية: ماذا تفعل كل عملية، وكم نموذجاً يستخدمها، ومن أول من قدمها بأوزان مفتوحة، وأين الدليل — الحقل الدقيق في config.json، والورقة الأصلية إن وُجدت.

عمليات الانتباه

العمليةالآلية والمعنىالنموذجأول متبنٍّ مفتوح الأوزانالدليل
MHA لكل رأس استعلام مجموعة key/value خاصة: تعبير كامل وأكبر ذاكرة KV. 10 GPT-2 (2019-02) num_attention_heads = num_key_value_heads · arXiv:1706.03762
GQA تتشارك رؤوس الاستعلام رؤوس KV في مجموعات صغيرة — معظم جودة MHA بجزء بسيط من الذاكرة. 46 Llama 2 70B (2023-07) num_key_value_heads < num_attention_heads · arXiv:2305.13245
MQA تتشارك كل رؤوس الاستعلام رأس KV واحداً: أدنى ذاكرة مع خسارة بسيطة في الجودة. 3 DeepSeek-V4-Flash (2026-04) num_key_value_heads = 1 · arXiv:1911.02150
MLA تُسقط المفاتيح/القيم إلى متجه كامن منخفض الرتبة مع مفتاح RoPE صغير منفصل؛ تتقلص الذاكرة بمرتبة من الحجم. 21 DeepSeek-V2 (2024-05) kv_lora_rank · arXiv:2405.04434
SWA ينتبه كل رمز داخل نافذة منزلقة حديثة فقط؛ تنمو الذاكرة والتكلفة خطياً مع السياق. 12 Mistral 7B (2023-09) sliding_window · arXiv:2310.06825
Linear attention (hybrid) طبقات انتباه خطي متكررة بذاكرة شبه ثابتة تتخللها أقلية من طبقات الانتباه الكامل. 0 linear_attn_config / layer types

التغذية الأمامية وMoE

العمليةالآلية والمعنىالنموذجأول متبنٍّ مفتوح الأوزانالدليل
MoE تتحول الشبكة التغذية إلى شبكة خبراء كثيرة؛ يوجّه الموجِّه top-k لكل رمز، فيفصل السعة عن الحساب. 55 DeepSeekMoE 16B (2024-01) n_routed_experts · num_experts_per_tok · arXiv:2401.06066
SwiGLU / SiLU وحدات خطية موجهة بـ SiLU — جودة أعلى لكل معامل من كتل GELU/ReLU البسيطة. 70 LLaMA 1 7B (2023-02) hidden_act = silu · arXiv:2002.05202

التطبيع والموضع

العمليةالآلية والمعنىالنموذجأول متبنٍّ مفتوح الأوزانالدليل
RMSNorm تطبيع بالجذر التربيعي للمتوسط دون تمركز المتوسط: أرخص ومستقر على النطاقات الكبيرة. 73 LLaMA 1 7B (2023-02) rms_norm_eps · arXiv:1910.07467
RoPE يرمز للموضع النسبي بتدوير أزواج Q/K؛ ويستقر خارجياً مع السياق بطبيعة الحال. 58 Mistral 7B (2023-09) rope_theta · arXiv:2104.09864
YaRN long-context يعيد قياس طيف ترددات RoPE لمد نافذة السياق إلى ما هو أبعد من طول التدريب المسبق بكثير. 0 rope_scaling.rope_type = yarn · arXiv:2309.00071

الاستدلال والدقة

العمليةالآلية والمعنىالنموذجأول متبنٍّ مفتوح الأوزانالدليل
Multi-Token Prediction رؤوس إضافية خفيفة تتنبأ بعدة رموز مستقبلية في كل تمريرة وتسرّع فك الترميز. 39 DeepSeek-V3 (2024-12) num_nextn_predict_layers · arXiv:2412.19437
FP8 training أوزان وتنشيطات بفاصلة عائمة 8 بت: نحو نصف الذاكرة وضرب مصفوفات أسرع في الأنطاقات القصوى. 18 DeepSeek-V3 (2024-12) torch_dtype / quantization_config

ملاحظة المنهجية

يُقرر التبني آلياً من config.json المرفق (عمود الدليل يسمي الحقول الدقيقة). «أول متبنٍّ» أقدم إصدار مفتوح الأوزان في المجموعة؛ والسوابق غير المفتوحة في صفحة الأوراق.