GLM · 2023-10 · デンス

ChatGLM3 6B

ChatGLM3 6B は GLM が 2023-10 に公開した グループ化クエリ注意(GQA) Transformer です。28 層、隠れ次元 4096、コンテキスト長 8,192 トークン。

層スタック

注意機構 ×28 · 層数 28

主要スペック

開発元GLM
公開日2023-10
総パラメータ6.2 B
コンテキスト8,192 tokens
注意機構GQA (32:2)
層数28
隠れ次元4,096
注意ヘッド32
語彙数
位置エンコーディング
正規化
活性化関数
学習精度bf16
アーキテクチャクラスChatGLMModel

アーキテクチャ概要

t₁ t₂ t₃ t₄ 入力トークン Embedding · 語彙数 — → 隠れ次元 4,096 Q1 Q2 Q3 Qn KV1 KV2 注意ヘッド 32 KVヘッド 2 head dim 128 · FFN · FFN次元 13,696 × 28 Transformer ブロック 注意機構 FFN / MoE pre-norm 最終正規化 · LM head → 語彙数 — p p p → 次のトークン 位置エンコーディング 学習精度 BF16 コンテキスト 8K tok
同梱の config.json に基づき作図 · 28 層 / 隠れ次元 4,096 / コンテキスト 8,192。図は本サイトのオリジナルです。

注意機構

グループ化クエリ注意(GQA) — 32 q-heads / 2 kv-heads.

FFN / MoE

デンスモデルであり、全 6.2B のパラメータがすべてのトークンの計算に参加します。

フィールド単位の比較

同一開発元の前世代モデルと比較します。前世代がない場合は構造最相似モデルと比較。倍数欄 = 本モデル ÷ 比較対象。

最相似 GLM-4 9B との全フィールド比較
モデルChatGLM3 6BGLM-4 9B倍数
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypefloat16bfloat16
_name_or_pathTHUDM/chatglm3-6bTHUDM/glm-4-9b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon0.000011.5625e-7×64.00
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers2840×0.700
original_ropetruetrue
padded_vocab_size65024151552×0.429
post_layer_normtruetrue
rmsnormtruetrue
seq_length81928192≈1

構造が最も近いモデル

類似度は 0(共通のカテゴリ特徴なし)から 1(構造プロファイルが完全に一致)の範囲です。

config.json の全フィールド

31 フィールド
_name_or_pathTHUDM/chatglm3-6b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon0.00001
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers28
original_ropetrue
padded_vocab_size65024
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypefloat16
transformers_version4.30.2
tie_word_embeddingsfalse
eos_token_id2
pad_token_id0