OpenAI · 2019-02 · デンス

GPT-2

GPT-2 は OpenAI が 2019-02 に公開した マルチヘッド注意(MHA) Transformer です。12 層、隠れ次元 768、コンテキスト長 1,024 トークン。

層スタック

注意機構 ×12 · 層数 12

主要スペック

開発元OpenAI
公開日2019-02
総パラメータ1.24 B
コンテキスト1,024 tokens
注意機構MHA (12:12)
層数12
隠れ次元768
注意ヘッド12
語彙数50,257
位置エンコーディングlearned-absolute
正規化LayerNorm
活性化関数
学習精度bf16
アーキテクチャクラスGPT2LMHeadModel

アーキテクチャ概要

t₁ t₂ t₃ t₄ 入力トークン Embedding · 語彙数 50,257 → 隠れ次元 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意ヘッド 12 KVヘッド 12 head dim 64 · learned-absolute FFN · FFN次元 — × 12 Transformer ブロック 注意機構 FFN / MoE LayerNorm pre-norm 最終正規化 · LayerNorm LM head → 語彙数 50,257 p p p → 次のトークン 位置エンコーディング learned-absolute 学習精度 BF16 コンテキスト 1K tok
同梱の config.json に基づき作図 · 12 層 / 隠れ次元 768 / コンテキスト 1,024。図は本サイトのオリジナルです。

注意機構

マルチヘッド注意(MHA) — 12 q-heads / 12 kv-heads.

FFN / MoE

デンスモデルであり、全 1.24B のパラメータがすべてのトークンの計算に参加します。

フィールド単位の比較

同一開発元の前世代モデルと比較します。前世代がない場合は構造最相似モデルと比較。倍数欄 = 本モデル ÷ 比較対象。

最相似 GPT-3 175B (paper) との全フィールド比較
モデルGPT-2GPT-3 175B (paper)倍数
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

構造が最も近いモデル

類似度は 0(共通のカテゴリ特徴なし)から 1(構造プロファイルが完全に一致)の範囲です。

config.json の全フィールド

20 フィールド
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257