OpenAI · 2020-05 · デンス

GPT-3 175B (paper)

GPT-3 175B (paper) は OpenAI が 2020-05 に公開した マルチヘッド注意(MHA) Transformer です。96 層、隠れ次元 12288、コンテキスト長 2,048 トークン。

原論文に基づく参照アーキテクチャ。重みは非公開です。

層スタック

注意機構 ×96 · 層数 96

主要スペック

開発元OpenAI
公開日2020-05
総パラメータ175 B
コンテキスト2,048 tokens
注意機構MHA (96:96)
層数96
隠れ次元12,288
注意ヘッド96
語彙数50,257
位置エンコーディングlearned-absolute
正規化
活性化関数gelu
学習精度
アーキテクチャクラスgpt3-paper

アーキテクチャ概要

t₁ t₂ t₃ t₄ 入力トークン Embedding · 語彙数 50,257 → 隠れ次元 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意ヘッド 96 KVヘッド 96 head dim 128 · learned-absolute FFN · GELU FFN次元 — × 96 Transformer ブロック 注意機構 FFN / MoE pre-norm 最終正規化 · LM head → 語彙数 50,257 p p p → 次のトークン 位置エンコーディング learned-absolute 学習精度 コンテキスト 2K tok
同梱の config.json に基づき作図 · 96 層 / 隠れ次元 12,288 / コンテキスト 2,048。図は本サイトのオリジナルです。

注意機構

マルチヘッド注意(MHA) — 96 q-heads / 96 kv-heads.

FFN / MoE

デンスモデルであり、全 175B のパラメータがすべてのトークンの計算に参加します。

フィールド単位の比較

同一開発元の前世代モデルと比較します。前世代がない場合は構造最相似モデルと比較。倍数欄 = 本モデル ÷ 比較対象。

前世代 GPT-2 との全フィールド比較
モデルGPT-3 175B (paper)GPT-2倍数
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

構造が最も近いモデル

類似度は 0(共通のカテゴリ特徴なし)から 1(構造プロファイルが完全に一致)の範囲です。

config.json の全フィールド

14 フィールド
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)