OpenAI · 2019-02 · Dicht

GPT-2

GPT-2 ist ein Multi-Head-Attention (MHA)-Transformer, veröffentlicht von OpenAI im 2019-02, mit 12 Schichten, Hidden-Größe 768 und einem Kontextfenster von 1,024 Tokens.

Schichtstapel

Attention ×12 · Schichten 12

Kernfakten

LaborOpenAI
Veröffentlicht2019-02
Parameter1.24 Mrd.
Kontext1,024 tokens
AttentionMHA (12:12)
Schichten12
Hidden-Dim.768
Attention-Köpfe12
Vokabular50,257
Positionscodierunglearned-absolute
NormierungLayerNorm
Aktivierung
Präzisionbf16
ArchitekturklasseGPT2LMHeadModel

Architekturüberblick

t₁ t₂ t₃ t₄ Eingabetokens Embedding · Vokabular 50,257 → Hidden-Dim. 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn Attention-Köpfe 12 KV-Köpfe 12 head dim 64 · learned-absolute FFN · FFN-Dim. — × 12 Transformer-Block Attention FFN / MoE LayerNorm pre-norm Finale Norm · LayerNorm LM head → Vokabular 50,257 p p p → nächstes Token Positionscodierung learned-absolute Präzision BF16 Kontext 1K tok
Gezeichnet nach der mitgelieferten config.json · 12 Schichten / Breite 768 / Kontext 1,024. Originaldiagramm dieses Atlas.

Attention

Multi-Head-Attention (MHA) — 12 q-heads / 12 kv-heads.

FFN / MoE

Es ist ein dichtes Modell: Alle 1.24 Mrd. Parameter sind an der Berechnung jedes Tokens beteiligt.

Feldweiser Vergleich

Verglichen mit dem vorherigen Modell desselben Labors; fehlt dieses, mit dem strukturell nächsten Modell. Die Spalte Ratio = dieses Modell ÷ Vergleichsmodell.

Vollfeldvergleich mit dem ähnlichsten Modell GPT-3 175B (paper)
ModellGPT-2GPT-3 175B (paper)Ratio
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

Strukturell ähnlichste Modelle

Ähnlichkeitswerte reichen von 0 (keine gemeinsamen kategorialen Merkmale) bis 1 (identische Profile).

Rohe Config-Felder

20 Felder
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257