Qwen · 2024-09 · 稠密

Qwen2.5 7B

Qwen2.5 7B 是 Qwen 於 2024-09 發布的 分組查詢注意力(GQA) Transformer,共 28 層,隱藏維度 3584,上下文視窗 32,768 個 token。

層堆疊

注意力 ×28 · 層數 28

關鍵參數

實驗室Qwen
發布時間2024-09
總參數7.6 B
上下文32,768 tokens
注意力GQA (28:4)
層數28
隱藏維度3,584
注意力頭28
詞表152,064
位置編碼RoPE
正規化RMSNorm
激活函數silu
訓練精度bf16
架構類別Qwen2ForCausalLM

架構概覽

t₁ t₂ t₃ t₄ 輸入 token Embedding · 詞表 152,064 → 隱藏維度 3,584 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意力頭 28 KV 頭 4 head dim 128 · RoPE FFN · SwiGLU FFN 維度 18,944 × 28 Transformer 块 注意力 前饋 / MoE RMSNorm pre-norm 最終正規化 · RMSNorm LM head → 詞表 152,064 p p p → 下一 token 位置編碼 RoPE 訓練精度 BF16 上下文 32K tok
依據隨權重發布的 config.json 繪製 · 28 層 / 寬 3,584 / 上下文 32,768。本圖為本站原創示意圖。

注意力

分組查詢注意力(GQA) — 28 q-heads / 4 kv-heads. RoPE θ=1,000,000.

前饋 / MoE

它是稠密模型:全部 7.6B 參數都參與每個 token 的計算。

欄位級對比

對比對象為同實驗室的上一代模型;無前代時取結構最相似的模型。倍數欄 = 本模型數值 ÷ 對比模型數值。

與前代 Qwen2.5 72B 的全欄位對比
模型Qwen2.5 7BQwen2.5 72B倍數
model_typeqwen2qwen2
architecturesQwen2ForCausalLMQwen2ForCausalLM
hidden_size35848192×0.438
num_hidden_layers2880×0.350
num_attention_heads2864×0.438
num_key_value_heads48×0.500
intermediate_size1894429568×0.641
hidden_actsilusilu
rope_theta10000001000000≈1
max_position_embeddings3276832768≈1
sliding_window131072131072≈1
rms_norm_eps0.0000010.000001≈1
vocab_size152064152064≈1
torch_dtypebfloat16bfloat16
attention_dropout00
bos_token_id151643151643≈1
eos_token_id151645151645≈1
initializer_range0.020.02≈1
max_window_layers2870×0.400
tie_word_embeddingsfalsefalse
transformers_version4.43.14.43.1
use_cachetruetrue
use_sliding_windowfalsefalse

結構最相似的模型

相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。

原始 config 欄位

23 個欄位
architecturesQwen2ForCausalLM
attention_dropout0
bos_token_id151643
eos_token_id151645
hidden_actsilu
hidden_size3584
initializer_range0.02
intermediate_size18944
max_position_embeddings32768
max_window_layers28
model_typeqwen2
num_attention_heads28
num_hidden_layers28
num_key_value_heads4
rms_norm_eps0.000001
rope_theta1000000
sliding_window131072
tie_word_embeddingsfalse
torch_dtypebfloat16
transformers_version4.43.1
use_cachetrue
use_sliding_windowfalse
vocab_size152064