OpenAI · 2019-02 · 稠密

GPT-2

GPT-2 是 OpenAI 於 2019-02 發布的 多頭注意力(MHA) Transformer,共 12 層,隱藏維度 768,上下文視窗 1,024 個 token。

層堆疊

注意力 ×12 · 層數 12

關鍵參數

實驗室OpenAI
發布時間2019-02
總參數1.24 B
上下文1,024 tokens
注意力MHA (12:12)
層數12
隱藏維度768
注意力頭12
詞表50,257
位置編碼learned-absolute
正規化LayerNorm
激活函數
訓練精度bf16
架構類別GPT2LMHeadModel

架構概覽

t₁ t₂ t₃ t₄ 輸入 token Embedding · 詞表 50,257 → 隱藏維度 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意力頭 12 KV 頭 12 head dim 64 · learned-absolute FFN · FFN 維度 — × 12 Transformer 块 注意力 前饋 / MoE LayerNorm pre-norm 最終正規化 · LayerNorm LM head → 詞表 50,257 p p p → 下一 token 位置編碼 learned-absolute 訓練精度 BF16 上下文 1K tok
依據隨權重發布的 config.json 繪製 · 12 層 / 寬 768 / 上下文 1,024。本圖為本站原創示意圖。

注意力

多頭注意力(MHA) — 12 q-heads / 12 kv-heads.

前饋 / MoE

它是稠密模型:全部 1.24B 參數都參與每個 token 的計算。

欄位級對比

對比對象為同實驗室的上一代模型;無前代時取結構最相似的模型。倍數欄 = 本模型數值 ÷ 對比模型數值。

與最相似 GPT-3 175B (paper) 的全欄位對比
模型GPT-2GPT-3 175B (paper)倍數
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

結構最相似的模型

相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。

原始 config 欄位

20 個欄位
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257