GLM · 2023-10 · 덴스

ChatGLM3 6B

ChatGLM3 6B은(는) GLM가 2023-10에 공개한 그룹화 쿼리 어텐션(GQA) Transformer로, 28개 층, 은닉 차원 4096, 컨텍스트 길이 8,192 토큰을 갖습니다.

레이어 스택

어텐션 ×28 · 레이어 수 28

핵심 사양

연구소GLM
공개일2023-10
총 파라미터6.2 B
컨텍스트8,192 tokens
어텐션GQA (32:2)
레이어 수28
은닉 차원4,096
어텐션 헤드32
어휘 크기
위치 인코딩
정규화
활성화 함수
학습 정밀도bf16
아키텍처 클래스ChatGLMModel

아키텍처 개요

t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 — → 은닉 차원 4,096 Q1 Q2 Q3 Qn KV1 KV2 어텐션 헤드 32 KV 헤드 2 head dim 128 · FFN · FFN 차원 13,696 × 28 Transformer 블록 어텐션 FFN / MoE pre-norm 최종 정규화 · LM head → 어휘 크기 — p p p → 다음 토큰 위치 인코딩 학습 정밀도 BF16 컨텍스트 8K tok
동봉된 config.json을 바탕으로 작도 · 28층 / 은닉 4,096 / 컨텍스트 8,192. 도식은 본 사이트의 오리지널입니다.

어텐션

그룹화 쿼리 어텐션(GQA) — 32 q-heads / 2 kv-heads.

FFN / MoE

덴스 모델로, 전체 6.2B 파라미터가 모든 토큰 계산에 참여합니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

가장 유사한 GLM-4 9B과의 전 필드 비교
모델ChatGLM3 6BGLM-4 9B배수
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypefloat16bfloat16
_name_or_pathTHUDM/chatglm3-6bTHUDM/glm-4-9b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon0.000011.5625e-7×64.00
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers2840×0.700
original_ropetruetrue
padded_vocab_size65024151552×0.429
post_layer_normtruetrue
rmsnormtruetrue
seq_length81928192≈1

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

31 개 필드
_name_or_pathTHUDM/chatglm3-6b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon0.00001
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers28
original_ropetrue
padded_vocab_size65024
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypefloat16
transformers_version4.30.2
tie_word_embeddingsfalse
eos_token_id2
pad_token_id0