OpenAI · 2019-02 · Densa

GPT-2

GPT-2 è un Transformer a attention multi-head (MHA) pubblicato da OpenAI nel 2019-02, con 12 strati, dimensione nascosta 768 e una finestra di contesto di 1,024 token.

Pila di strati

Attention ×12 · Strati 12

Dati chiave

LaboratorioOpenAI
Pubblicazione2019-02
Parametri1.24 mld
Contesto1,024 tokens
AttentionMHA (12:12)
Strati12
Dim. nascosta768
Teste di attention12
Vocabolario50,257
Codifica posizionalelearned-absolute
NormalizzazioneLayerNorm
Attivazione
Precisionebf16
Classe architetturaleGPT2LMHeadModel

Panoramica dell'architettura

t₁ t₂ t₃ t₄ token di ingresso Embedding · Vocabolario 50,257 → Dim. nascosta 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn Teste di attention 12 Teste KV 12 head dim 64 · learned-absolute FFN · Dim. FFN — × 12 blocco transformer Attention FFN / MoE LayerNorm pre-norm Normalizzazione finale · LayerNorm LM head → Vocabolario 50,257 p p p → token successivo Codifica posizionale learned-absolute Precisione BF16 Contesto 1K tok
Disegnato dal config.json distribuito · 12 strati / larghezza 768 / contesto 1,024. Schema originale di questo atlante.

Attention

attention multi-head (MHA) — 12 q-heads / 12 kv-heads.

FFN / MoE

È un modello denso: tutti i 1.24 milioni di parametri partecipano al calcolo di ogni token.

Confronto campo per campo

Confronto con il modello precedente dello stesso laboratorio; in assenza, col modello strutturalmente più vicino. La colonna rapporto = questo modello ÷ modello di confronto.

Confronto completo con il più simile, GPT-3 175B (paper)
ModelloGPT-2GPT-3 175B (paper)Rapporto
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

Architetture più simili

I valori di similarità vanno da 0 (nessuna caratteristica categoriale condivisa) a 1 (profili identici).

Campi grezzi del config.json

20 campi
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257