GLM · 2023-10 · Densa

ChatGLM3 6B

ChatGLM3 6B è un Transformer a attention grouped-query (GQA) pubblicato da GLM nel 2023-10, con 28 strati, dimensione nascosta 4096 e una finestra di contesto di 8,192 token.

Pila di strati

Attention ×28 · Strati 28

Dati chiave

LaboratorioGLM
Pubblicazione2023-10
Parametri6.2 mld
Contesto8,192 tokens
AttentionGQA (32:2)
Strati28
Dim. nascosta4,096
Teste di attention32
Vocabolario
Codifica posizionale
Normalizzazione
Attivazione
Precisionebf16
Classe architetturaleChatGLMModel

Panoramica dell'architettura

t₁ t₂ t₃ t₄ token di ingresso Embedding · Vocabolario — → Dim. nascosta 4,096 Q1 Q2 Q3 Qn KV1 KV2 Teste di attention 32 Teste KV 2 head dim 128 · FFN · Dim. FFN 13,696 × 28 blocco transformer Attention FFN / MoE pre-norm Normalizzazione finale · LM head → Vocabolario — p p p → token successivo Codifica posizionale Precisione BF16 Contesto 8K tok
Disegnato dal config.json distribuito · 28 strati / larghezza 4,096 / contesto 8,192. Schema originale di questo atlante.

Attention

attention grouped-query (GQA) — 32 q-heads / 2 kv-heads.

FFN / MoE

È un modello denso: tutti i 6.2 milioni di parametri partecipano al calcolo di ogni token.

Confronto campo per campo

Confronto con il modello precedente dello stesso laboratorio; in assenza, col modello strutturalmente più vicino. La colonna rapporto = questo modello ÷ modello di confronto.

Confronto completo con il più simile, GLM-4 9B
ModelloChatGLM3 6BGLM-4 9BRapporto
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypefloat16bfloat16
_name_or_pathTHUDM/chatglm3-6bTHUDM/glm-4-9b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon0.000011.5625e-7×64.00
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers2840×0.700
original_ropetruetrue
padded_vocab_size65024151552×0.429
post_layer_normtruetrue
rmsnormtruetrue
seq_length81928192≈1

Architetture più simili

I valori di similarità vanno da 0 (nessuna caratteristica categoriale condivisa) a 1 (profili identici).

Campi grezzi del config.json

31 campi
_name_or_pathTHUDM/chatglm3-6b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon0.00001
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers28
original_ropetrue
padded_vocab_size65024
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypefloat16
transformers_version4.30.2
tie_word_embeddingsfalse
eos_token_id2
pad_token_id0