GLM · 2024-06 · مكثّف

GLM-4 9B

GLM-4 9B هو محول انتباه الاستعلامات المجمّعة (GQA) أصدره GLM في 2024-06، ويضم 40 طبقة وبعداً مخفياً قدره 4096 ونافذة سياق تبلغ 8,192 رمزاً.

كومة الطبقات

الانتباه ×40 · الطبقات 40

حقائق رئيسية

المعملGLM
تاريخ الإصدار2024-06
المعاملات9.4 مليار
السياق8,192 tokens
الانتباهGQA (32:2)
الطبقات40
بعد الطبقة المخفية4,096
رؤوس الانتباه32
حجم المفردات
ترميز الموضع
التطبيع
دالة التنشيط
الدقةbf16
فئة المعماريةChatGLMModel

نظرة عامة على المعمارية

t₁ t₂ t₃ t₄ رموز الإدخال Embedding · حجم المفردات — → بعد الطبقة المخفية 4,096 Q1 Q2 Q3 Qn KV1 KV2 رؤوس الانتباه 32 رؤوس KV 2 head dim 128 · FFN · بعد FFN 13,696 × 40 كتلة Transformer الانتباه الشبكة التغذية / MoE pre-norm التطبيع النهائي · LM head → حجم المفردات — p p p → الرمز التالي ترميز الموضع الدقة BF16 السياق 8K tok
مرسوم من config.json المرفق · 40 طبقة / العرض 4,096 / السياق 8,192. رسم أصلي من هذا الأطلس.

الانتباه

انتباه الاستعلامات المجمّعة (GQA) — 32 q-heads / 2 kv-heads.

الشبكة التغذية / MoE

هو نموذج مكثف: تشارك كامل المعاملات البالغة 9.4 مليار في حساب كل رمز.

مقارنة حقل بحقل

المقارنة مع النموذج السابق في المعمل نفسه؛ وإن لم يوجد فمع النموذج الأقرب بنيوياً. عمود النسبة = هذا النموذج ÷ نموذج المقارنة.

مقارنة كاملة بالسابق ChatGLM3 6B
النموذجGLM-4 9BChatGLM3 6Bالنسبة
model_typechatglmchatglm
architecturesChatGLMModelChatGLMModel
hidden_size40964096≈1
num_attention_heads3232≈1
torch_dtypebfloat16float16
_name_or_pathTHUDM/glm-4-9bTHUDM/chatglm3-6b
add_bias_linearfalsefalse
add_qkv_biastruetrue
apply_query_key_layer_scalingtruetrue
apply_residual_connection_post_layernormfalsefalse
attention_dropout00
attention_softmax_in_fp32truetrue
attn_implementationsdpa
bias_dropout_fusiontruetrue
ffn_hidden_size1369613696≈1
fp32_residual_connectionfalsefalse
hidden_dropout00
kv_channels128128≈1
layernorm_epsilon1.5625e-70.00001×0.016
multi_query_attentiontruetrue
multi_query_group_num22≈1
num_layers4028×1.43
original_ropetruetrue
padded_vocab_size15155265024×2.33
post_layer_normtruetrue
rmsnormtruetrue

أكثر المعماريات تشابهاً

تتراوح درجات التشابه من 0 (لا سمات فئوية مشتركة) إلى 1 (ملفات بنيوية متطابقة).

حقول config.json الخام

32 حقل
_name_or_pathTHUDM/glm-4-9b
model_typechatglm
architecturesChatGLMModel
add_bias_linearfalse
add_qkv_biastrue
apply_query_key_layer_scalingtrue
apply_residual_connection_post_layernormfalse
attention_dropout0
attention_softmax_in_fp32true
attn_implementationsdpa
bias_dropout_fusiontrue
ffn_hidden_size13696
fp32_residual_connectionfalse
hidden_dropout0
hidden_size4096
kv_channels128
layernorm_epsilon1.5625e-7
multi_query_attentiontrue
multi_query_group_num2
num_attention_heads32
num_layers40
original_ropetrue
padded_vocab_size151552
post_layer_normtrue
rmsnormtrue
seq_length8192
use_cachetrue
torch_dtypebfloat16
transformers_version4.44.0
tie_word_embeddingsfalse
eos_token_id151329×1 + 151336×1 + 151338×1
pad_token_id151329