OpenAI · 2020-05 · مكثّف

GPT-3 175B (paper)

GPT-3 175B (paper) هو محول انتباه متعدد الرؤوس (MHA) أصدره OpenAI في 2020-05، ويضم 96 طبقة وبعداً مخفياً قدره 12288 ونافذة سياق تبلغ 2,048 رمزاً.

معمارية مرجعية من الورقة الأصلية؛ لا توجد أوزان مفتوحة.

كومة الطبقات

الانتباه ×96 · الطبقات 96

حقائق رئيسية

المعملOpenAI
تاريخ الإصدار2020-05
المعاملات175 مليار
السياق2,048 tokens
الانتباهMHA (96:96)
الطبقات96
بعد الطبقة المخفية12,288
رؤوس الانتباه96
حجم المفردات50,257
ترميز الموضعlearned-absolute
التطبيع
دالة التنشيطgelu
الدقة
فئة المعماريةgpt3-paper

نظرة عامة على المعمارية

t₁ t₂ t₃ t₄ رموز الإدخال Embedding · حجم المفردات 50,257 → بعد الطبقة المخفية 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn رؤوس الانتباه 96 رؤوس KV 96 head dim 128 · learned-absolute FFN · GELU بعد FFN — × 96 كتلة Transformer الانتباه الشبكة التغذية / MoE pre-norm التطبيع النهائي · LM head → حجم المفردات 50,257 p p p → الرمز التالي ترميز الموضع learned-absolute الدقة السياق 2K tok
مرسوم من config.json المرفق · 96 طبقة / العرض 12,288 / السياق 2,048. رسم أصلي من هذا الأطلس.

الانتباه

انتباه متعدد الرؤوس (MHA) — 96 q-heads / 96 kv-heads.

الشبكة التغذية / MoE

هو نموذج مكثف: تشارك كامل المعاملات البالغة 175 مليار في حساب كل رمز.

مقارنة حقل بحقل

المقارنة مع النموذج السابق في المعمل نفسه؛ وإن لم يوجد فمع النموذج الأقرب بنيوياً. عمود النسبة = هذا النموذج ÷ نموذج المقارنة.

مقارنة كاملة بالسابق GPT-2
النموذجGPT-3 175B (paper)GPT-2النسبة
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

أكثر المعماريات تشابهاً

تتراوح درجات التشابه من 0 (لا سمات فئوية مشتركة) إلى 1 (ملفات بنيوية متطابقة).

حقول config.json الخام

14 حقل
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)