OpenAI · 2020-05 · 稠密
GPT-3 175B (paper)
GPT-3 175B (paper) 是 OpenAI 於 2020-05 發布的 多頭注意力(MHA) Transformer,共 96 層,隱藏維度 12288,上下文視窗 2,048 個 token。
取自原始論文的參考架構,未開放權重。
層堆疊
注意力 ×96 · 層數 96
關鍵參數
| 實驗室 | OpenAI |
|---|---|
| 發布時間 | 2020-05 |
| 總參數 | 175 B |
| 上下文 | 2,048 tokens |
| 注意力 | MHA (96:96) |
| 層數 | 96 |
| 隱藏維度 | 12,288 |
| 注意力頭 | 96 |
| 詞表 | 50,257 |
| 位置編碼 | learned-absolute |
| 正規化 | — |
| 激活函數 | gelu |
| 訓練精度 | — |
| 架構類別 | gpt3-paper |
架構概覽
注意力
多頭注意力(MHA) — 96 q-heads / 96 kv-heads.
前饋 / MoE
它是稠密模型:全部 175B 參數都參與每個 token 的計算。
欄位級對比
對比對象為同實驗室的上一代模型;無前代時取結構最相似的模型。倍數欄 = 本模型數值 ÷ 對比模型數值。
與前代 GPT-2 的全欄位對比
| 模型 | GPT-3 175B (paper) | GPT-2 | 倍數 |
|---|---|---|---|
| model_type | gpt3-paper | gpt2 | ≠ |
| architectures | — | GPT2LMHeadModel | |
| hidden_size | 12288 | — | |
| num_attention_heads | 96 | — | |
| max_position_embeddings | 2048 | — | |
| layer_norm_epsilon | — | 0.00001 | |
| vocab_size | 50257 | 50257 | ≈1 |
| _note | GPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci) | — | |
| source | paper:arXiv:2005.14165 | — | |
| num_layers | 96 | — | |
| n_head_kv | 96 | — | |
| activation | gelu | — | |
| positional_encoding | learned:absolute | — | |
| normalization | LayerNorm(pre+post) | — | |
| residual | post-LN style | — | |
| attention | MHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1) | — |
結構最相似的模型
- GPT-2 (OpenAI, 2019-02) 0.744
- Step-3 (StepFun, 2025-07) 0.687
- Step-3.7-Flash (StepFun, 2026-05) 0.613
- Step-3.5-Flash (StepFun, 2026-03) 0.613
- LLaMA 1 7B (Meta, 2023-02) 0.581
- Qwen1.5 7B (Qwen, 2024-02) 0.528
相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。
原始 config 欄位
14 個欄位
| _note | GPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci) |
|---|---|
| source | paper:arXiv:2005.14165 |
| model_type | gpt3-paper |
| num_layers | 96 |
| hidden_size | 12288 |
| num_attention_heads | 96 |
| n_head_kv | 96 |
| max_position_embeddings | 2048 |
| vocab_size | 50257 |
| activation | gelu |
| positional_encoding | learned:absolute |
| normalization | LayerNorm(pre+post) |
| residual | post-LN style |
| attention | MHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1) |