OpenAI · 2020-05 · Dicht

GPT-3 175B (paper)

GPT-3 175B (paper) ist ein Multi-Head-Attention (MHA)-Transformer, veröffentlicht von OpenAI im 2020-05, mit 96 Schichten, Hidden-Größe 12288 und einem Kontextfenster von 2,048 Tokens.

Referenzarchitektur aus dem Originalpaper; keine offenen Gewichte.

Schichtstapel

Attention ×96 · Schichten 96

Kernfakten

LaborOpenAI
Veröffentlicht2020-05
Parameter175 Mrd.
Kontext2,048 tokens
AttentionMHA (96:96)
Schichten96
Hidden-Dim.12,288
Attention-Köpfe96
Vokabular50,257
Positionscodierunglearned-absolute
Normierung
Aktivierunggelu
Präzision
Architekturklassegpt3-paper

Architekturüberblick

t₁ t₂ t₃ t₄ Eingabetokens Embedding · Vokabular 50,257 → Hidden-Dim. 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn Attention-Köpfe 96 KV-Köpfe 96 head dim 128 · learned-absolute FFN · GELU FFN-Dim. — × 96 Transformer-Block Attention FFN / MoE pre-norm Finale Norm · LM head → Vokabular 50,257 p p p → nächstes Token Positionscodierung learned-absolute Präzision Kontext 2K tok
Gezeichnet nach der mitgelieferten config.json · 96 Schichten / Breite 12,288 / Kontext 2,048. Originaldiagramm dieses Atlas.

Attention

Multi-Head-Attention (MHA) — 96 q-heads / 96 kv-heads.

FFN / MoE

Es ist ein dichtes Modell: Alle 175 Mrd. Parameter sind an der Berechnung jedes Tokens beteiligt.

Feldweiser Vergleich

Verglichen mit dem vorherigen Modell desselben Labors; fehlt dieses, mit dem strukturell nächsten Modell. Die Spalte Ratio = dieses Modell ÷ Vergleichsmodell.

Vollfeldvergleich mit dem Vorgänger GPT-2
ModellGPT-3 175B (paper)GPT-2Ratio
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

Strukturell ähnlichste Modelle

Ähnlichkeitswerte reichen von 0 (keine gemeinsamen kategorialen Merkmale) bis 1 (identische Profile).

Rohe Config-Felder

14 Felder
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)