GLM · 2024-06 · デンス

GLM-4 9B

GLM-4 9B は GLM が 2024-06 に公開した グループ化クエリ注意(GQA) Transformer です。40 層、隠れ次元 4096、コンテキスト長 8,192 トークン。

層スタック

注意機構 ×40 · 層数 40

主要スペック

開発元GLM
公開日2024-06
総パラメータ9.4 B
コンテキスト8,192 tokens
注意機構GQA (32:2)
層数40
隠れ次元4,096
注意ヘッド32
語彙数
位置エンコーディング
正規化
活性化関数
学習精度bf16
アーキテクチャクラスChatGLMModel

アーキテクチャ概要

t₁ t₂ t₃ t₄ 入力トークン Embedding · 語彙数 — → 隠れ次元 4,096 Q1 Q2 Q3 Qn KV1 KV2 注意ヘッド 32 KVヘッド 2 head dim 128 · FFN · FFN次元 13,696 × 40 Transformer ブロック 注意機構 FFN / MoE pre-norm 最終正規化 · LM head → 語彙数 — p p p → 次のトークン 位置エンコーディング 学習精度 BF16 コンテキスト 8K tok
同梱の config.json に基づき作図 · 40 層 / 隠れ次元 4,096 / コンテキスト 8,192。図は本サイトのオリジナルです。

注意機構

グループ化クエリ注意(GQA) — 32 q-heads / 2 kv-heads.

FFN / MoE

デンスモデルであり、全 9.4B のパラメータがすべてのトークンの計算に参加します。

フィールド単位の比較

同一開発元の前世代モデルと比較します。前世代がない場合は構造最相似モデルと比較。倍数欄 = 本モデル ÷ 比較対象。

前世代 ChatGLM3 6B との全フィールド比較
モデルGLM-4 9BChatGLM3 6B倍数
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypebfloat16float16
_name_or_pathTHUDM/glm-4-9bTHUDM/chatglm3-6b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
attn_implementationsdpa
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon1.5625e-70.00001×0.016
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers4028×1.43
original_ropetruetrue
padded_vocab_size15155265024×2.33
post_layer_normtruetrue
rmsnormtruetrue

構造が最も近いモデル

類似度は 0(共通のカテゴリ特徴なし)から 1(構造プロファイルが完全に一致)の範囲です。

config.json の全フィールド

32 フィールド
_name_or_pathTHUDM/glm-4-9b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
attn_implementationsdpa
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon1.5625e-7
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers40
original_ropetrue
padded_vocab_size151552
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypebfloat16
transformers_version4.44.0
tie_word_embeddingsfalse
eos_token_id151329×1 + 151336×1 + 151338×1
pad_token_id151329