OpenAI · 2019-02 · مكثّف

GPT-2

GPT-2 هو محول انتباه متعدد الرؤوس (MHA) أصدره OpenAI في 2019-02، ويضم 12 طبقة وبعداً مخفياً قدره 768 ونافذة سياق تبلغ 1,024 رمزاً.

كومة الطبقات

الانتباه ×12 · الطبقات 12

حقائق رئيسية

المعملOpenAI
تاريخ الإصدار2019-02
المعاملات1.24 مليار
السياق1,024 tokens
الانتباهMHA (12:12)
الطبقات12
بعد الطبقة المخفية768
رؤوس الانتباه12
حجم المفردات50,257
ترميز الموضعlearned-absolute
التطبيعLayerNorm
دالة التنشيط
الدقةbf16
فئة المعماريةGPT2LMHeadModel

نظرة عامة على المعمارية

t₁ t₂ t₃ t₄ رموز الإدخال Embedding · حجم المفردات 50,257 → بعد الطبقة المخفية 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn رؤوس الانتباه 12 رؤوس KV 12 head dim 64 · learned-absolute FFN · بعد FFN — × 12 كتلة Transformer الانتباه الشبكة التغذية / MoE LayerNorm pre-norm التطبيع النهائي · LayerNorm LM head → حجم المفردات 50,257 p p p → الرمز التالي ترميز الموضع learned-absolute الدقة BF16 السياق 1K tok
مرسوم من config.json المرفق · 12 طبقة / العرض 768 / السياق 1,024. رسم أصلي من هذا الأطلس.

الانتباه

انتباه متعدد الرؤوس (MHA) — 12 q-heads / 12 kv-heads.

الشبكة التغذية / MoE

هو نموذج مكثف: تشارك كامل المعاملات البالغة 1.24 مليار في حساب كل رمز.

مقارنة حقل بحقل

المقارنة مع النموذج السابق في المعمل نفسه؛ وإن لم يوجد فمع النموذج الأقرب بنيوياً. عمود النسبة = هذا النموذج ÷ نموذج المقارنة.

مقارنة كاملة بالأقرب GPT-3 175B (paper)
النموذجGPT-2GPT-3 175B (paper)النسبة
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

أكثر المعماريات تشابهاً

تتراوح درجات التشابه من 0 (لا سمات فئوية مشتركة) إلى 1 (ملفات بنيوية متطابقة).

حقول config.json الخام

20 حقل
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257