OpenAI · 2019-02 · 稠密

GPT-2

GPT-2 是 OpenAI 于 2019-02 发布的 多头注意力(MHA) Transformer,共 12 层,隐藏维度 768,上下文窗口 1,024 个 token。

层堆栈

注意力 ×12 · 层数 12

关键参数

实验室OpenAI
发布时间2019-02
总参数1.24 B
上下文1,024 tokens
注意力MHA (12:12)
层数12
隐藏维度768
注意力头12
词表50,257
位置编码learned-absolute
归一化LayerNorm
激活函数
训练精度bf16
架构类名GPT2LMHeadModel

架构概览

t₁ t₂ t₃ t₄ 输入 token Embedding · 词表 50,257 → 隐藏维度 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意力头 12 KV 头 12 head dim 64 · learned-absolute FFN · FFN 维度 — × 12 Transformer 块 注意力 前馈 / MoE LayerNorm pre-norm 最终归一化 · LayerNorm LM head → 词表 50,257 p p p → 下一 token 位置编码 learned-absolute 训练精度 BF16 上下文 1K tok
依据随权重发布的 config.json 绘制 · 12 层 / 宽 768 / 上下文 1,024。本图为本站原创示意图。

注意力

多头注意力(MHA) — 12 q-heads / 12 kv-heads.

前馈 / MoE

它是稠密模型:全部 1.24B 参数都参与每个 token 的计算。

字段级对比

对比对象为同实验室的上一代模型;无前代时取结构最相似的模型。倍数列 = 本模型数值 ÷ 对比模型数值。

与最相似 GPT-3 175B (paper) 的全字段对比
模型GPT-2GPT-3 175B (paper)倍数
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

结构最相似的模型

相似度取值范围 0(无共同类别特征)到 1(结构画像完全一致)。

原始 config 字段

20 个字段
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257