OpenAI · 2019-02 · 덴스
GPT-2
GPT-2은(는) OpenAI가 2019-02에 공개한 멀티헤드 어텐션(MHA) Transformer로, 12개 층, 은닉 차원 768, 컨텍스트 길이 1,024 토큰을 갖습니다.
레이어 스택
어텐션 ×12 · 레이어 수 12
핵심 사양
| 연구소 | OpenAI |
|---|---|
| 공개일 | 2019-02 |
| 총 파라미터 | 1.24 B |
| 컨텍스트 | 1,024 tokens |
| 어텐션 | MHA (12:12) |
| 레이어 수 | 12 |
| 은닉 차원 | 768 |
| 어텐션 헤드 | 12 |
| 어휘 크기 | 50,257 |
| 위치 인코딩 | learned-absolute |
| 정규화 | LayerNorm |
| 활성화 함수 | — |
| 학습 정밀도 | bf16 |
| 아키텍처 클래스 | GPT2LMHeadModel |
아키텍처 개요
어텐션
멀티헤드 어텐션(MHA) — 12 q-heads / 12 kv-heads.
FFN / MoE
덴스 모델로, 전체 1.24B 파라미터가 모든 토큰 계산에 참여합니다.
필드 단위 비교
같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.
가장 유사한 GPT-3 175B (paper)과의 전 필드 비교
| 모델 | GPT-2 | GPT-3 175B (paper) | 배수 |
|---|---|---|---|
| model_type | gpt2 | gpt3-paper | ≠ |
| architectures | GPT2LMHeadModel | — | |
| hidden_size | — | 12288 | |
| num_attention_heads | — | 96 | |
| max_position_embeddings | — | 2048 | |
| layer_norm_epsilon | 0.00001 | — | |
| vocab_size | 50257 | 50257 | ≈1 |
| activation_function | gelu_new | — | |
| attn_pdrop | 0.1 | — | |
| bos_token_id | 50256 | — | |
| embd_pdrop | 0.1 | — | |
| eos_token_id | 50256 | — | |
| initializer_range | 0.02 | — | |
| n_ctx | 1024 | — | |
| n_embd | 768 | — | |
| n_head | 12 | — | |
| n_layer | 12 | — | |
| n_positions | 1024 | — | |
| resid_pdrop | 0.1 | — | |
| summary_first_dropout | 0.1 | — | |
| summary_proj_to_labels | true | — | |
| summary_type | cls_index | — | |
| summary_use_proj | true | — |
구조가 가장 유사한 모델
- GPT-3 175B (paper) (OpenAI, 2020-05) 0.744
- LLaMA 1 7B (Meta, 2023-02) 0.629
- Step-3 (StepFun, 2025-07) 0.604
- Step-3.5-Flash (StepFun, 2026-03) 0.602
- Step-3.7-Flash (StepFun, 2026-05) 0.602
- Qwen1.5 7B (Qwen, 2024-02) 0.580
유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.
config.json 전체 필드
20 개 필드
| activation_function | gelu_new |
|---|---|
| architectures | GPT2LMHeadModel |
| attn_pdrop | 0.1 |
| bos_token_id | 50256 |
| embd_pdrop | 0.1 |
| eos_token_id | 50256 |
| initializer_range | 0.02 |
| layer_norm_epsilon | 0.00001 |
| model_type | gpt2 |
| n_ctx | 1024 |
| n_embd | 768 |
| n_head | 12 |
| n_layer | 12 |
| n_positions | 1024 |
| resid_pdrop | 0.1 |
| summary_first_dropout | 0.1 |
| summary_proj_to_labels | true |
| summary_type | cls_index |
| summary_use_proj | true |
| vocab_size | 50257 |