OpenAI · 2020-05 · مكثّف
GPT-3 175B (paper)
GPT-3 175B (paper) هو محول انتباه متعدد الرؤوس (MHA) أصدره OpenAI في 2020-05، ويضم 96 طبقة وبعداً مخفياً قدره 12288 ونافذة سياق تبلغ 2,048 رمزاً.
معمارية مرجعية من الورقة الأصلية؛ لا توجد أوزان مفتوحة.
كومة الطبقات
الانتباه ×96 · الطبقات 96
حقائق رئيسية
| المعمل | OpenAI |
|---|---|
| تاريخ الإصدار | 2020-05 |
| المعاملات | 175 مليار |
| السياق | 2,048 tokens |
| الانتباه | MHA (96:96) |
| الطبقات | 96 |
| بعد الطبقة المخفية | 12,288 |
| رؤوس الانتباه | 96 |
| حجم المفردات | 50,257 |
| ترميز الموضع | learned-absolute |
| التطبيع | — |
| دالة التنشيط | gelu |
| الدقة | — |
| فئة المعمارية | gpt3-paper |
نظرة عامة على المعمارية
الانتباه
انتباه متعدد الرؤوس (MHA) — 96 q-heads / 96 kv-heads.
الشبكة التغذية / MoE
هو نموذج مكثف: تشارك كامل المعاملات البالغة 175 مليار في حساب كل رمز.
مقارنة حقل بحقل
المقارنة مع النموذج السابق في المعمل نفسه؛ وإن لم يوجد فمع النموذج الأقرب بنيوياً. عمود النسبة = هذا النموذج ÷ نموذج المقارنة.
مقارنة كاملة بالسابق GPT-2
| النموذج | GPT-3 175B (paper) | GPT-2 | النسبة |
|---|---|---|---|
| model_type | gpt3-paper | gpt2 | ≠ |
| architectures | — | GPT2LMHeadModel | |
| hidden_size | 12288 | — | |
| num_attention_heads | 96 | — | |
| max_position_embeddings | 2048 | — | |
| layer_norm_epsilon | — | 0.00001 | |
| vocab_size | 50257 | 50257 | ≈1 |
| _note | GPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci) | — | |
| source | paper:arXiv:2005.14165 | — | |
| num_layers | 96 | — | |
| n_head_kv | 96 | — | |
| activation | gelu | — | |
| positional_encoding | learned:absolute | — | |
| normalization | LayerNorm(pre+post) | — | |
| residual | post-LN style | — | |
| attention | MHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1) | — |
أكثر المعماريات تشابهاً
- GPT-2 (OpenAI, 2019-02) 0.744
- Step-3 (StepFun, 2025-07) 0.687
- Step-3.7-Flash (StepFun, 2026-05) 0.613
- Step-3.5-Flash (StepFun, 2026-03) 0.613
- LLaMA 1 7B (Meta, 2023-02) 0.581
- Qwen1.5 7B (Qwen, 2024-02) 0.528
تتراوح درجات التشابه من 0 (لا سمات فئوية مشتركة) إلى 1 (ملفات بنيوية متطابقة).
حقول config.json الخام
14 حقل
| _note | GPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci) |
|---|---|
| source | paper:arXiv:2005.14165 |
| model_type | gpt3-paper |
| num_layers | 96 |
| hidden_size | 12288 |
| num_attention_heads | 96 |
| n_head_kv | 96 |
| max_position_embeddings | 2048 |
| vocab_size | 50257 |
| activation | gelu |
| positional_encoding | learned:absolute |
| normalization | LayerNorm(pre+post) |
| residual | post-LN style |
| attention | MHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1) |