OpenAI · 2020-05 · 덴스

GPT-3 175B (paper)

GPT-3 175B (paper)은(는) OpenAI가 2020-05에 공개한 멀티헤드 어텐션(MHA) Transformer로, 96개 층, 은닉 차원 12288, 컨텍스트 길이 2,048 토큰을 갖습니다.

원 논문의 참조 아키텍처로, 가중치는 비공개입니다.

레이어 스택

어텐션 ×96 · 레이어 수 96

핵심 사양

연구소OpenAI
공개일2020-05
총 파라미터175 B
컨텍스트2,048 tokens
어텐션MHA (96:96)
레이어 수96
은닉 차원12,288
어텐션 헤드96
어휘 크기50,257
위치 인코딩learned-absolute
정규화
활성화 함수gelu
학습 정밀도
아키텍처 클래스gpt3-paper

아키텍처 개요

t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 50,257 → 은닉 차원 12,288 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 어텐션 헤드 96 KV 헤드 96 head dim 128 · learned-absolute FFN · GELU FFN 차원 — × 96 Transformer 블록 어텐션 FFN / MoE pre-norm 최종 정규화 · LM head → 어휘 크기 50,257 p p p → 다음 토큰 위치 인코딩 learned-absolute 학습 정밀도 컨텍스트 2K tok
동봉된 config.json을 바탕으로 작도 · 96층 / 은닉 12,288 / 컨텍스트 2,048. 도식은 본 사이트의 오리지널입니다.

어텐션

멀티헤드 어텐션(MHA) — 96 q-heads / 96 kv-heads.

FFN / MoE

덴스 모델로, 전체 175B 파라미터가 모든 토큰 계산에 참여합니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

이전 세대 GPT-2과의 전 필드 비교
모델GPT-3 175B (paper)GPT-2배수
model_typegpt3-papergpt2
architecturesGPT2LMHeadModel
hidden_size12288
num_attention_heads96
max_position_embeddings2048
layer_norm_epsilon0.00001
vocab_size5025750257≈1
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
num_layers96
n_head_kv96
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

14 개 필드
_noteGPT-3 未开源权重,本表字段取自 arXiv:2005.14165 Table 2.1 (GPT-3 175B/davinci)
sourcepaper:arXiv:2005.14165
model_typegpt3-paper
num_layers96
hidden_size12288
num_attention_heads96
n_head_kv96
max_position_embeddings2048
vocab_size50257
activationgelu
positional_encodinglearned:absolute
normalizationLayerNorm(pre+post)
residualpost-LN style
attentionMHA, alternating local(sp=256)/global per layer (GPT-3 paper §2.1)