OpenAI · 2019-02 · Densa
GPT-2
GPT-2 è un Transformer a attention multi-head (MHA) pubblicato da OpenAI nel 2019-02, con 12 strati, dimensione nascosta 768 e una finestra di contesto di 1,024 token.
Pila di strati
Attention ×12 · Strati 12
Dati chiave
| Laboratorio | OpenAI |
|---|---|
| Pubblicazione | 2019-02 |
| Parametri | 1.24 mld |
| Contesto | 1,024 tokens |
| Attention | MHA (12:12) |
| Strati | 12 |
| Dim. nascosta | 768 |
| Teste di attention | 12 |
| Vocabolario | 50,257 |
| Codifica posizionale | learned-absolute |
| Normalizzazione | LayerNorm |
| Attivazione | — |
| Precisione | bf16 |
| Classe architetturale | GPT2LMHeadModel |
Panoramica dell'architettura
Attention
attention multi-head (MHA) — 12 q-heads / 12 kv-heads.
FFN / MoE
È un modello denso: tutti i 1.24 milioni di parametri partecipano al calcolo di ogni token.
Confronto campo per campo
Confronto con il modello precedente dello stesso laboratorio; in assenza, col modello strutturalmente più vicino. La colonna rapporto = questo modello ÷ modello di confronto.
Confronto completo con il più simile, GPT-3 175B (paper)
| Modello | GPT-2 | GPT-3 175B (paper) | Rapporto |
|---|---|---|---|
| model_type | gpt2 | gpt3-paper | ≠ |
| architectures | GPT2LMHeadModel | — | |
| hidden_size | — | 12288 | |
| num_attention_heads | — | 96 | |
| max_position_embeddings | — | 2048 | |
| layer_norm_epsilon | 0.00001 | — | |
| vocab_size | 50257 | 50257 | ≈1 |
| activation_function | gelu_new | — | |
| attn_pdrop | 0.1 | — | |
| bos_token_id | 50256 | — | |
| embd_pdrop | 0.1 | — | |
| eos_token_id | 50256 | — | |
| initializer_range | 0.02 | — | |
| n_ctx | 1024 | — | |
| n_embd | 768 | — | |
| n_head | 12 | — | |
| n_layer | 12 | — | |
| n_positions | 1024 | — | |
| resid_pdrop | 0.1 | — | |
| summary_first_dropout | 0.1 | — | |
| summary_proj_to_labels | true | — | |
| summary_type | cls_index | — | |
| summary_use_proj | true | — |
Architetture più simili
- GPT-3 175B (paper) (OpenAI, 2020-05) 0.744
- LLaMA 1 7B (Meta, 2023-02) 0.629
- Step-3 (StepFun, 2025-07) 0.604
- Step-3.5-Flash (StepFun, 2026-03) 0.602
- Step-3.7-Flash (StepFun, 2026-05) 0.602
- Qwen1.5 7B (Qwen, 2024-02) 0.580
I valori di similarità vanno da 0 (nessuna caratteristica categoriale condivisa) a 1 (profili identici).
Campi grezzi del config.json
20 campi
| activation_function | gelu_new |
|---|---|
| architectures | GPT2LMHeadModel |
| attn_pdrop | 0.1 |
| bos_token_id | 50256 |
| embd_pdrop | 0.1 |
| eos_token_id | 50256 |
| initializer_range | 0.02 |
| layer_norm_epsilon | 0.00001 |
| model_type | gpt2 |
| n_ctx | 1024 |
| n_embd | 768 |
| n_head | 12 |
| n_layer | 12 |
| n_positions | 1024 |
| resid_pdrop | 0.1 |
| summary_first_dropout | 0.1 |
| summary_proj_to_labels | true |
| summary_type | cls_index |
| summary_use_proj | true |
| vocab_size | 50257 |