OpenAI · 2020-05 · Densa

GPT-3 175B (paper)

GPT-3 175B (paper) è un Transformer a attention multi-head (MHA) pubblicato da OpenAI nel 2020-05, con 96 strati, dimensione nascosta 12288 e una finestra di contesto di 2,048 token.

Architettura di riferimento tratta dall'articolo originale; nessun peso pubblico.

Pila di strati

Attention ×96 · Strati 96

Dati chiave

LaboratorioOpenAI
Pubblicazione2020-05
Parametri175 mld
Contesto2,048 tokens
AttentionMHA (96:96)
Strati96
Dim. nascosta12,288
Teste di attention96
Vocabolario50,257
Codifica posizionalelearned-absolute
Normalizzazione
Attivazionegelu
Precisione
Classe architetturalegpt3-paper

Panoramica dell'architettura

t₁ t₂ t₃ t₄ token di ingresso Embedding · Vocabolario 50,257 → Dim. nascosta 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn Teste di attention 96 Teste KV 96 head dim 128 · learned-absolute FFN · GELU Dim. FFN — × 96 blocco transformer Attention FFN / MoE pre-norm Normalizzazione finale · LM head → Vocabolario 50,257 p p p → token successivo Codifica posizionale learned-absolute Precisione Contesto 2K tok
Disegnato dal config.json distribuito · 96 strati / larghezza 12,288 / contesto 2,048. Schema originale di questo atlante.

Attention

attention multi-head (MHA) — 96 q-heads / 96 kv-heads.

FFN / MoE

È un modello denso: tutti i 175 milioni di parametri partecipano al calcolo di ogni token.

Confronto campo per campo

Confronto con il modello precedente dello stesso laboratorio; in assenza, col modello strutturalmente più vicino. La colonna rapporto = questo modello ÷ modello di confronto.

Confronto completo con il predecessore GPT-2
ModelloGPT-3 175B (paper)GPT-2Rapporto
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

Architetture più simili

I valori di similarità vanno da 0 (nessuna caratteristica categoriale condivisa) a 1 (profili identici).

Campi grezzi del config.json

14 campi
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)