OpenAI · 2020-05 · Dense

GPT-3 175B (paper)

GPT-3 175B (paper) est un Transformer à attention multi-tête (MHA) publié par OpenAI en 2020-05, avec 96 couches, une dimension cachée de 12288 et une fenêtre de contexte de 2,048 tokens.

Architecture de référence tirée de l'article original ; aucun poids public.

Pile de couches

Attention ×96 · Couches 96

Faits clés

LaboratoireOpenAI
Publication2020-05
Paramètres175 Md
Contexte2,048 tokens
AttentionMHA (96:96)
Couches96
Dimension cachée12,288
Têtes d'attention96
Vocabulaire50,257
Encodage positionnellearned-absolute
Normalisation
Activationgelu
Précision
Classe d'architecturegpt3-paper

Vue d'ensemble de l'architecture

t₁ t₂ t₃ t₄ tokens d’entrée Embedding · Vocabulaire 50,257 → Dimension cachée 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn Têtes d'attention 96 Têtes KV 96 head dim 128 · learned-absolute FFN · GELU Dim. FFN — × 96 bloc transformer Attention FFN / MoE pre-norm Norme finale · LM head → Vocabulaire 50,257 p p p → token suivant Encodage positionnel learned-absolute Précision Contexte 2K tok
Dessiné d’après le config.json livré · 96 couches / largeur 12,288 / contexte 2,048. Schéma original de cet atlas.

Attention

attention multi-tête (MHA) — 96 q-heads / 96 kv-heads.

FFN / MoE

C’est un modèle dense : la totalité des 175Md de paramètres participe au calcul de chaque token.

Comparaison champ à champ

Comparé au modèle précédent du même labo ; à défaut, au modèle structurellement le plus proche. La colonne ratio = ce modèle ÷ le modèle comparé.

Comparaison complète avec le prédécesseur GPT-2
ModèleGPT-3 175B (paper)GPT-2Ratio
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

Architectures les plus proches

La similarité varie de 0 (aucune caractéristique catégorielle commune) à 1 (profils identiques).

Champs bruts du config.json

14 champs
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)