GLM · 2024-06 · Densa

GLM-4 9B

GLM-4 9B è un Transformer a attention grouped-query (GQA) pubblicato da GLM nel 2024-06, con 40 strati, dimensione nascosta 4096 e una finestra di contesto di 8,192 token.

Pila di strati

Attention ×40 · Strati 40

Dati chiave

LaboratorioGLM
Pubblicazione2024-06
Parametri9.4 mld
Contesto8,192 tokens
AttentionGQA (32:2)
Strati40
Dim. nascosta4,096
Teste di attention32
Vocabolario
Codifica posizionale
Normalizzazione
Attivazione
Precisionebf16
Classe architetturaleChatGLMModel

Panoramica dell'architettura

t₁ t₂ t₃ t₄ token di ingresso Embedding · Vocabolario — → Dim. nascosta 4,096 Q1 Q2 Q3 Qn KV1 KV2 Teste di attention 32 Teste KV 2 head dim 128 · FFN · Dim. FFN 13,696 × 40 blocco transformer Attention FFN / MoE pre-norm Normalizzazione finale · LM head → Vocabolario — p p p → token successivo Codifica posizionale Precisione BF16 Contesto 8K tok
Disegnato dal config.json distribuito · 40 strati / larghezza 4,096 / contesto 8,192. Schema originale di questo atlante.

Attention

attention grouped-query (GQA) — 32 q-heads / 2 kv-heads.

FFN / MoE

È un modello denso: tutti i 9.4 milioni di parametri partecipano al calcolo di ogni token.

Confronto campo per campo

Confronto con il modello precedente dello stesso laboratorio; in assenza, col modello strutturalmente più vicino. La colonna rapporto = questo modello ÷ modello di confronto.

Confronto completo con il predecessore ChatGLM3 6B
ModelloGLM-4 9BChatGLM3 6BRapporto
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypebfloat16float16
_name_or_pathTHUDM/glm-4-9bTHUDM/chatglm3-6b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
attn_implementationsdpa
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon1.5625e-70.00001×0.016
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers4028×1.43
original_ropetruetrue
padded_vocab_size15155265024×2.33
post_layer_normtruetrue
rmsnormtruetrue

Architetture più simili

I valori di similarità vanno da 0 (nessuna caratteristica categoriale condivisa) a 1 (profili identici).

Campi grezzi del config.json

32 campi
_name_or_pathTHUDM/glm-4-9b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
attn_implementationsdpa
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon1.5625e-7
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers40
original_ropetrue
padded_vocab_size151552
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypebfloat16
transformers_version4.44.0
tie_word_embeddingsfalse
eos_token_id151329×1 + 151336×1 + 151338×1
pad_token_id151329