OpenAI · 2020-05 · 稠密
GPT-3 175B (paper)
GPT-3 175B (paper) 是 OpenAI 于 2020-05 发布的 多头注意力(MHA) Transformer,共 96 层,隐藏维度 12288,上下文窗口 2,048 个 token。
取自原始论文的参考架构,未开放权重。
层堆栈
注意力 ×96 · 层数 96
关键参数
| 实验室 | OpenAI |
|---|---|
| 发布时间 | 2020-05 |
| 总参数 | 175 B |
| 上下文 | 2,048 tokens |
| 注意力 | MHA (96:96) |
| 层数 | 96 |
| 隐藏维度 | 12,288 |
| 注意力头 | 96 |
| 词表 | 50,257 |
| 位置编码 | learned-absolute |
| 归一化 | — |
| 激活函数 | gelu |
| 训练精度 | — |
| 架构类名 | gpt3-paper |
架构概览
注意力
多头注意力(MHA) — 96 q-heads / 96 kv-heads.
前馈 / MoE
它是稠密模型:全部 175B 参数都参与每个 token 的计算。
字段级对比
对比对象为同实验室的上一代模型;无前代时取结构最相似的模型。倍数列 = 本模型数值 ÷ 对比模型数值。
与前代 GPT-2 的全字段对比
| 模型 | GPT-3 175B (paper) | GPT-2 | 倍数 |
|---|---|---|---|
| model_type | gpt3-paper | gpt2 | ≠ |
| architectures | — | GPT2LMHeadModel | |
| hidden_size | 12288 | — | |
| num_attention_heads | 96 | — | |
| max_position_embeddings | 2048 | — | |
| layer_norm_epsilon | — | 0.00001 | |
| vocab_size | 50257 | 50257 | ≈1 |
| _note | GPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci) | — | |
| source | paper:arXiv:2005.14165 | — | |
| num_layers | 96 | — | |
| n_head_kv | 96 | — | |
| activation | gelu | — | |
| positional_encoding | learned:absolute | — | |
| normalization | LayerNorm(pre+post) | — | |
| residual | post-LN style | — | |
| attention | MHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1) | — |
结构最相似的模型
- GPT-2 (OpenAI, 2019-02) 0.744
- Step-3 (StepFun, 2025-07) 0.687
- Step-3.7-Flash (StepFun, 2026-05) 0.613
- Step-3.5-Flash (StepFun, 2026-03) 0.613
- LLaMA 1 7B (Meta, 2023-02) 0.581
- Qwen1.5 7B (Qwen, 2024-02) 0.528
相似度取值范围 0(无共同类别特征)到 1(结构画像完全一致)。
原始 config 字段
14 个字段
| _note | GPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci) |
|---|---|
| source | paper:arXiv:2005.14165 |
| model_type | gpt3-paper |
| num_layers | 96 |
| hidden_size | 12288 |
| num_attention_heads | 96 |
| n_head_kv | 96 |
| max_position_embeddings | 2048 |
| vocab_size | 50257 |
| activation | gelu |
| positional_encoding | learned:absolute |
| normalization | LayerNorm(pre+post) |
| residual | post-LN style |
| attention | MHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1) |