OpenAI · 2019-02 · Dicht
GPT-2
GPT-2 ist ein Multi-Head-Attention (MHA)-Transformer, veröffentlicht von OpenAI im 2019-02, mit 12 Schichten, Hidden-Größe 768 und einem Kontextfenster von 1,024 Tokens.
Schichtstapel
Attention ×12 · Schichten 12
Kernfakten
| Labor | OpenAI |
|---|---|
| Veröffentlicht | 2019-02 |
| Parameter | 1.24 Mrd. |
| Kontext | 1,024 tokens |
| Attention | MHA (12:12) |
| Schichten | 12 |
| Hidden-Dim. | 768 |
| Attention-Köpfe | 12 |
| Vokabular | 50,257 |
| Positionscodierung | learned-absolute |
| Normierung | LayerNorm |
| Aktivierung | — |
| Präzision | bf16 |
| Architekturklasse | GPT2LMHeadModel |
Architekturüberblick
Attention
Multi-Head-Attention (MHA) — 12 q-heads / 12 kv-heads.
FFN / MoE
Es ist ein dichtes Modell: Alle 1.24 Mrd. Parameter sind an der Berechnung jedes Tokens beteiligt.
Feldweiser Vergleich
Verglichen mit dem vorherigen Modell desselben Labors; fehlt dieses, mit dem strukturell nächsten Modell. Die Spalte Ratio = dieses Modell ÷ Vergleichsmodell.
Vollfeldvergleich mit dem ähnlichsten Modell GPT-3 175B (paper)
| Modell | GPT-2 | GPT-3 175B (paper) | Ratio |
|---|---|---|---|
| model_type | gpt2 | gpt3-paper | ≠ |
| architectures | GPT2LMHeadModel | — | |
| hidden_size | — | 12288 | |
| num_attention_heads | — | 96 | |
| max_position_embeddings | — | 2048 | |
| layer_norm_epsilon | 0.00001 | — | |
| vocab_size | 50257 | 50257 | ≈1 |
| activation_function | gelu_new | — | |
| attn_pdrop | 0.1 | — | |
| bos_token_id | 50256 | — | |
| embd_pdrop | 0.1 | — | |
| eos_token_id | 50256 | — | |
| initializer_range | 0.02 | — | |
| n_ctx | 1024 | — | |
| n_embd | 768 | — | |
| n_head | 12 | — | |
| n_layer | 12 | — | |
| n_positions | 1024 | — | |
| resid_pdrop | 0.1 | — | |
| summary_first_dropout | 0.1 | — | |
| summary_proj_to_labels | true | — | |
| summary_type | cls_index | — | |
| summary_use_proj | true | — |
Strukturell ähnlichste Modelle
- GPT-3 175B (paper) (OpenAI, 2020-05) 0.744
- LLaMA 1 7B (Meta, 2023-02) 0.629
- Step-3 (StepFun, 2025-07) 0.604
- Step-3.5-Flash (StepFun, 2026-03) 0.602
- Step-3.7-Flash (StepFun, 2026-05) 0.602
- Qwen1.5 7B (Qwen, 2024-02) 0.580
Ähnlichkeitswerte reichen von 0 (keine gemeinsamen kategorialen Merkmale) bis 1 (identische Profile).
Rohe Config-Felder
20 Felder
| activation_function | gelu_new |
|---|---|
| architectures | GPT2LMHeadModel |
| attn_pdrop | 0.1 |
| bos_token_id | 50256 |
| embd_pdrop | 0.1 |
| eos_token_id | 50256 |
| initializer_range | 0.02 |
| layer_norm_epsilon | 0.00001 |
| model_type | gpt2 |
| n_ctx | 1024 |
| n_embd | 768 |
| n_head | 12 |
| n_layer | 12 |
| n_positions | 1024 |
| resid_pdrop | 0.1 |
| summary_first_dropout | 0.1 |
| summary_proj_to_labels | true |
| summary_type | cls_index |
| summary_use_proj | true |
| vocab_size | 50257 |