OpenAI · 2020-05 · 稠密

GPT-3 175B (paper)

GPT-3 175B (paper) 是 OpenAI 于 2020-05 发布的 多头注意力(MHA) Transformer,共 96 层,隐藏维度 12288,上下文窗口 2,048 个 token。

取自原始论文的参考架构,未开放权重。

层堆栈

注意力 ×96 · 层数 96

关键参数

实验室OpenAI
发布时间2020-05
总参数175 B
上下文2,048 tokens
注意力MHA (96:96)
层数96
隐藏维度12,288
注意力头96
词表50,257
位置编码learned-absolute
归一化
激活函数gelu
训练精度
架构类名gpt3-paper

架构概览

t₁ t₂ t₃ t₄ 输入 token Embedding · 词表 50,257 → 隐藏维度 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意力头 96 KV 头 96 head dim 128 · learned-absolute FFN · GELU FFN 维度 — × 96 Transformer 块 注意力 前馈 / MoE pre-norm 最终归一化 · LM head → 词表 50,257 p p p → 下一 token 位置编码 learned-absolute 训练精度 上下文 2K tok
依据随权重发布的 config.json 绘制 · 96 层 / 宽 12,288 / 上下文 2,048。本图为本站原创示意图。

注意力

多头注意力(MHA) — 96 q-heads / 96 kv-heads.

前馈 / MoE

它是稠密模型:全部 175B 参数都参与每个 token 的计算。

字段级对比

对比对象为同实验室的上一代模型;无前代时取结构最相似的模型。倍数列 = 本模型数值 ÷ 对比模型数值。

与前代 GPT-2 的全字段对比
模型GPT-3 175B (paper)GPT-2倍数
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

结构最相似的模型

相似度取值范围 0(无共同类别特征)到 1(结构画像完全一致)。

原始 config 字段

14 个字段
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)