OpenAI · 2019-02 · 덴스

GPT-2

GPT-2은(는) OpenAI가 2019-02에 공개한 멀티헤드 어텐션(MHA) Transformer로, 12개 층, 은닉 차원 768, 컨텍스트 길이 1,024 토큰을 갖습니다.

레이어 스택

어텐션 ×12 · 레이어 수 12

핵심 사양

연구소OpenAI
공개일2019-02
총 파라미터1.24 B
컨텍스트1,024 tokens
어텐션MHA (12:12)
레이어 수12
은닉 차원768
어텐션 헤드12
어휘 크기50,257
위치 인코딩learned-absolute
정규화LayerNorm
활성화 함수
학습 정밀도bf16
아키텍처 클래스GPT2LMHeadModel

아키텍처 개요

t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 50,257 → 은닉 차원 768 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 어텐션 헤드 12 KV 헤드 12 head dim 64 · learned-absolute FFN · FFN 차원 — × 12 Transformer 블록 어텐션 FFN / MoE LayerNorm pre-norm 최종 정규화 · LayerNorm LM head → 어휘 크기 50,257 p p p → 다음 토큰 위치 인코딩 learned-absolute 학습 정밀도 BF16 컨텍스트 1K tok
동봉된 config.json을 바탕으로 작도 · 12층 / 은닉 768 / 컨텍스트 1,024. 도식은 본 사이트의 오리지널입니다.

어텐션

멀티헤드 어텐션(MHA) — 12 q-heads / 12 kv-heads.

FFN / MoE

덴스 모델로, 전체 1.24B 파라미터가 모든 토큰 계산에 참여합니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

가장 유사한 GPT-3 175B (paper)과의 전 필드 비교
모델GPT-2GPT-3 175B (paper)배수
model_typegpt2gpt3-paper
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
activation_functiongelu_new
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

20 개 필드
activation_functiongelu_new
architecturesGPT2LMHeadModel
attn_pdrop0.1
bos_token_id50256
embd_pdrop0.1
eos_token_id50256
initializer_range0.02
layer_norm_epsilon0.00001
model_typegpt2
n_ctx1024
n_embd768
n_head12
n_layer12
n_positions1024
resid_pdrop0.1
summary_first_dropout0.1
summary_proj_to_labelstrue
summary_typecls_index
summary_use_projtrue
vocab_size50257