OpenAI · 2019-02 · 稠密
GPT-2
GPT-2 是 OpenAI 于 2019-02 发布的 多头注意力(MHA) Transformer,共 12 层,隐藏维度 768,上下文窗口 1,024 个 token。
层堆栈
注意力 ×12 · 层数 12
关键参数
| 实验室 | OpenAI |
|---|---|
| 发布时间 | 2019-02 |
| 总参数 | 1.24 B |
| 上下文 | 1,024 tokens |
| 注意力 | MHA (12:12) |
| 层数 | 12 |
| 隐藏维度 | 768 |
| 注意力头 | 12 |
| 词表 | 50,257 |
| 位置编码 | learned-absolute |
| 归一化 | LayerNorm |
| 激活函数 | — |
| 训练精度 | bf16 |
| 架构类名 | GPT2LMHeadModel |
架构概览
注意力
多头注意力(MHA) — 12 q-heads / 12 kv-heads.
前馈 / MoE
它是稠密模型:全部 1.24B 参数都参与每个 token 的计算。
字段级对比
对比对象为同实验室的上一代模型;无前代时取结构最相似的模型。倍数列 = 本模型数值 ÷ 对比模型数值。
与最相似 GPT-3 175B (paper) 的全字段对比
| 模型 | GPT-2 | GPT-3 175B (paper) | 倍数 |
|---|---|---|---|
| model_type | gpt2 | gpt3-paper | ≠ |
| architectures | GPT2LMHeadModel | — | |
| hidden_size | — | 12288 | |
| num_attention_heads | — | 96 | |
| max_position_embeddings | — | 2048 | |
| layer_norm_epsilon | 0.00001 | — | |
| vocab_size | 50257 | 50257 | ≈1 |
| activation_function | gelu_new | — | |
| attn_pdrop | 0.1 | — | |
| bos_token_id | 50256 | — | |
| embd_pdrop | 0.1 | — | |
| eos_token_id | 50256 | — | |
| initializer_range | 0.02 | — | |
| n_ctx | 1024 | — | |
| n_embd | 768 | — | |
| n_head | 12 | — | |
| n_layer | 12 | — | |
| n_positions | 1024 | — | |
| resid_pdrop | 0.1 | — | |
| summary_first_dropout | 0.1 | — | |
| summary_proj_to_labels | true | — | |
| summary_type | cls_index | — | |
| summary_use_proj | true | — |
结构最相似的模型
- GPT-3 175B (paper) (OpenAI, 2020-05) 0.744
- LLaMA 1 7B (Meta, 2023-02) 0.629
- Step-3 (StepFun, 2025-07) 0.604
- Step-3.5-Flash (StepFun, 2026-03) 0.602
- Step-3.7-Flash (StepFun, 2026-05) 0.602
- Qwen1.5 7B (Qwen, 2024-02) 0.580
相似度取值范围 0(无共同类别特征)到 1(结构画像完全一致)。
原始 config 字段
20 个字段
| activation_function | gelu_new |
|---|---|
| architectures | GPT2LMHeadModel |
| attn_pdrop | 0.1 |
| bos_token_id | 50256 |
| embd_pdrop | 0.1 |
| eos_token_id | 50256 |
| initializer_range | 0.02 |
| layer_norm_epsilon | 0.00001 |
| model_type | gpt2 |
| n_ctx | 1024 |
| n_embd | 768 |
| n_head | 12 |
| n_layer | 12 |
| n_positions | 1024 |
| resid_pdrop | 0.1 |
| summary_first_dropout | 0.1 |
| summary_proj_to_labels | true |
| summary_type | cls_index |
| summary_use_proj | true |
| vocab_size | 50257 |