GLM · 2024-06 · 덴스

GLM-4 9B

GLM-4 9B은(는) GLM가 2024-06에 공개한 그룹화 쿼리 어텐션(GQA) Transformer로, 40개 층, 은닉 차원 4096, 컨텍스트 길이 8,192 토큰을 갖습니다.

레이어 스택

어텐션 ×40 · 레이어 수 40

핵심 사양

연구소GLM
공개일2024-06
총 파라미터9.4 B
컨텍스트8,192 tokens
어텐션GQA (32:2)
레이어 수40
은닉 차원4,096
어텐션 헤드32
어휘 크기
위치 인코딩
정규화
활성화 함수
학습 정밀도bf16
아키텍처 클래스ChatGLMModel

아키텍처 개요

t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 — → 은닉 차원 4,096 Q1 Q2 Q3 Qn KV1 KV2 어텐션 헤드 32 KV 헤드 2 head dim 128 · FFN · FFN 차원 13,696 × 40 Transformer 블록 어텐션 FFN / MoE pre-norm 최종 정규화 · LM head → 어휘 크기 — p p p → 다음 토큰 위치 인코딩 학습 정밀도 BF16 컨텍스트 8K tok
동봉된 config.json을 바탕으로 작도 · 40층 / 은닉 4,096 / 컨텍스트 8,192. 도식은 본 사이트의 오리지널입니다.

어텐션

그룹화 쿼리 어텐션(GQA) — 32 q-heads / 2 kv-heads.

FFN / MoE

덴스 모델로, 전체 9.4B 파라미터가 모든 토큰 계산에 참여합니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

이전 세대 ChatGLM3 6B과의 전 필드 비교
모델GLM-4 9BChatGLM3 6B배수
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypebfloat16float16
_name_or_pathTHUDM/glm-4-9bTHUDM/chatglm3-6b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
attn_implementationsdpa
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon1.5625e-70.00001×0.016
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers4028×1.43
original_ropetruetrue
padded_vocab_size15155265024×2.33
post_layer_normtruetrue
rmsnormtruetrue

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

32 개 필드
_name_or_pathTHUDM/glm-4-9b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
attn_implementationsdpa
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon1.5625e-7
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers40
original_ropetrue
padded_vocab_size151552
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypebfloat16
transformers_version4.44.0
tie_word_embeddingsfalse
eos_token_id151329×1 + 151336×1 + 151338×1
pad_token_id151329