OpenAI · 2019-02 · مكثّف
GPT-2
GPT-2 هو محول انتباه متعدد الرؤوس (MHA) أصدره OpenAI في 2019-02، ويضم 12 طبقة وبعداً مخفياً قدره 768 ونافذة سياق تبلغ 1,024 رمزاً.
كومة الطبقات
الانتباه ×12 · الطبقات 12
حقائق رئيسية
| المعمل | OpenAI |
|---|---|
| تاريخ الإصدار | 2019-02 |
| المعاملات | 1.24 مليار |
| السياق | 1,024 tokens |
| الانتباه | MHA (12:12) |
| الطبقات | 12 |
| بعد الطبقة المخفية | 768 |
| رؤوس الانتباه | 12 |
| حجم المفردات | 50,257 |
| ترميز الموضع | learned-absolute |
| التطبيع | LayerNorm |
| دالة التنشيط | — |
| الدقة | bf16 |
| فئة المعمارية | GPT2LMHeadModel |
نظرة عامة على المعمارية
الانتباه
انتباه متعدد الرؤوس (MHA) — 12 q-heads / 12 kv-heads.
الشبكة التغذية / MoE
هو نموذج مكثف: تشارك كامل المعاملات البالغة 1.24 مليار في حساب كل رمز.
مقارنة حقل بحقل
المقارنة مع النموذج السابق في المعمل نفسه؛ وإن لم يوجد فمع النموذج الأقرب بنيوياً. عمود النسبة = هذا النموذج ÷ نموذج المقارنة.
مقارنة كاملة بالأقرب GPT-3 175B (paper)
| النموذج | GPT-2 | GPT-3 175B (paper) | النسبة |
|---|---|---|---|
| model_type | gpt2 | gpt3-paper | ≠ |
| architectures | GPT2LMHeadModel | — | |
| hidden_size | — | 12288 | |
| num_attention_heads | — | 96 | |
| max_position_embeddings | — | 2048 | |
| layer_norm_epsilon | 0.00001 | — | |
| vocab_size | 50257 | 50257 | ≈1 |
| activation_function | gelu_new | — | |
| attn_pdrop | 0.1 | — | |
| bos_token_id | 50256 | — | |
| embd_pdrop | 0.1 | — | |
| eos_token_id | 50256 | — | |
| initializer_range | 0.02 | — | |
| n_ctx | 1024 | — | |
| n_embd | 768 | — | |
| n_head | 12 | — | |
| n_layer | 12 | — | |
| n_positions | 1024 | — | |
| resid_pdrop | 0.1 | — | |
| summary_first_dropout | 0.1 | — | |
| summary_proj_to_labels | true | — | |
| summary_type | cls_index | — | |
| summary_use_proj | true | — |
أكثر المعماريات تشابهاً
- GPT-3 175B (paper) (OpenAI, 2020-05) 0.744
- LLaMA 1 7B (Meta, 2023-02) 0.629
- Step-3 (StepFun, 2025-07) 0.604
- Step-3.5-Flash (StepFun, 2026-03) 0.602
- Step-3.7-Flash (StepFun, 2026-05) 0.602
- Qwen1.5 7B (Qwen, 2024-02) 0.580
تتراوح درجات التشابه من 0 (لا سمات فئوية مشتركة) إلى 1 (ملفات بنيوية متطابقة).
حقول config.json الخام
20 حقل
| activation_function | gelu_new |
|---|---|
| architectures | GPT2LMHeadModel |
| attn_pdrop | 0.1 |
| bos_token_id | 50256 |
| embd_pdrop | 0.1 |
| eos_token_id | 50256 |
| initializer_range | 0.02 |
| layer_norm_epsilon | 0.00001 |
| model_type | gpt2 |
| n_ctx | 1024 |
| n_embd | 768 |
| n_head | 12 |
| n_layer | 12 |
| n_positions | 1024 |
| resid_pdrop | 0.1 |
| summary_first_dropout | 0.1 |
| summary_proj_to_labels | true |
| summary_type | cls_index |
| summary_use_proj | true |
| vocab_size | 50257 |