GLM · 2023-10 · 稠密

ChatGLM3 6B

ChatGLM3 6B 是 GLM 於 2023-10 發布的 分組查詢注意力(GQA) Transformer,共 28 層,隱藏維度 4096,上下文視窗 8,192 個 token。

層堆疊

注意力 ×28 · 層數 28

關鍵參數

實驗室GLM
發布時間2023-10
總參數6.2 B
上下文8,192 tokens
注意力GQA (32:2)
層數28
隱藏維度4,096
注意力頭32
詞表
位置編碼
正規化
激活函數
訓練精度bf16
架構類別ChatGLMModel

架構概覽

t₁ t₂ t₃ t₄ 輸入 token Embedding · 詞表 — → 隱藏維度 4,096 Q1 Q2 Q3 Qn KV1 KV2 注意力頭 32 KV 頭 2 head dim 128 · FFN · FFN 維度 13,696 × 28 Transformer 块 注意力 前饋 / MoE pre-norm 最終正規化 · LM head → 詞表 — p p p → 下一 token 位置編碼 訓練精度 BF16 上下文 8K tok
依據隨權重發布的 config.json 繪製 · 28 層 / 寬 4,096 / 上下文 8,192。本圖為本站原創示意圖。

注意力

分組查詢注意力(GQA) — 32 q-heads / 2 kv-heads.

前饋 / MoE

它是稠密模型:全部 6.2B 參數都參與每個 token 的計算。

欄位級對比

對比對象為同實驗室的上一代模型;無前代時取結構最相似的模型。倍數欄 = 本模型數值 ÷ 對比模型數值。

與最相似 GLM-4 9B 的全欄位對比
模型ChatGLM3 6BGLM-4 9B倍數
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypefloat16bfloat16
_name_or_pathTHUDM/chatglm3-6bTHUDM/glm-4-9b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon0.000011.5625e-7×64.00
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers2840×0.700
original_ropetruetrue
padded_vocab_size65024151552×0.429
post_layer_normtruetrue
rmsnormtruetrue
seq_length81928192≈1

結構最相似的模型

相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。

原始 config 欄位

31 個欄位
_name_or_pathTHUDM/chatglm3-6b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon0.00001
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers28
original_ropetrue
padded_vocab_size65024
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypefloat16
transformers_version4.30.2
tie_word_embeddingsfalse
eos_token_id2
pad_token_id0