DeepSeek · 2024-01 · スパースMoE

DeepSeekMoE 16B

DeepSeekMoE 16B は DeepSeek が 2024-01 に公開した マルチヘッド注意(MHA) Transformer です。28 層、隠れ次元 2048、コンテキスト長 4,096 トークン。

層スタック

注意機構 ×28 · 層数 28

主要スペック

開発元DeepSeek
公開日2024-01
総パラメータ16.2 B
活性パラメータ2.6 B
コンテキスト4,096 tokens
注意機構MHA (16:16)
層数28
隠れ次元2,048
注意ヘッド16
語彙数102,400
位置エンコーディングRoPE
正規化RMSNorm
活性化関数silu
学習精度bf16
アーキテクチャクラスDeepseekForCausalLM

アーキテクチャ概要

t₁ t₂ t₃ t₄ 入力トークン Embedding · 語彙数 102,400 → 隠れ次元 2,048 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意ヘッド 16 KVヘッド 16 head dim 128 · RoPE ルーター E1 E2 E3 E4 E5 E6 E7 E8 +56… 共有エキスパート ×2 64 エキスパートから top-6 · トークンごとに約 2.6B パラメータ活性 × 28 Transformer ブロック 注意機構 FFN / MoE RMSNorm pre-norm 最終正規化 · RMSNorm LM head → 語彙数 102,400 p p p → 次のトークン 位置エンコーディング RoPE 学習精度 BF16 コンテキスト 4K tok
同梱の config.json に基づき作図 · 28 層 / 隠れ次元 2,048 / コンテキスト 4,096。図は本サイトのオリジナルです。

注意機構

マルチヘッド注意(MHA) — 16 q-heads / 16 kv-heads. RoPE θ=10,000.

FFN / MoE

スパースなMixture-of-Expertsモデルで、64 個のルーティングエキスパートと top-6 ルーティングを持ち、トークンごとに約 2.6B のパラメータが活性化します。

フィールド単位の比較

同一開発元の前世代モデルと比較します。前世代がない場合は構造最相似モデルと比較。倍数欄 = 本モデル ÷ 比較対象。

前世代 DeepSeek LLM 7B との全フィールド比較
モデルDeepSeekMoE 16BDeepSeek LLM 7B倍数
model_typedeepseekllama
architecturesDeepseekForCausalLMLlamaForCausalLM
hidden_size20484096×0.500
num_hidden_layers2830×0.933
num_attention_heads1632×0.500
num_key_value_heads1632×0.500
intermediate_size1094411008×0.994
hidden_actsilusilu
n_routed_experts64
num_experts_per_tok6
n_shared_experts2
moe_intermediate_size1408
rope_theta1000010000≈1
max_position_embeddings40964096≈1
rms_norm_eps0.0000010.000001≈1
vocab_size102400102400≈1
torch_dtypebfloat16bfloat16
attention_biasfalse
attention_dropout0
bos_token_id1000001×100000.00
eos_token_id1000012×50000.50
first_k_dense_replace1
initializer_range0.020.02≈1
moe_layer_freq1
norm_topk_probfalse
pretraining_tp11≈1

構造が最も近いモデル

類似度は 0(共通のカテゴリ特徴なし)から 1(構造プロファイルが完全に一致)の範囲です。

config.json の全フィールド

30 フィールド
architecturesDeepseekForCausalLM
attention_biasfalse
attention_dropout0
bos_token_id100000
eos_token_id100001
first_k_dense_replace1
hidden_actsilu
hidden_size2048
initializer_range0.02
intermediate_size10944
max_position_embeddings4096
model_typedeepseek
moe_intermediate_size1408
moe_layer_freq1
n_routed_experts64
n_shared_experts2
norm_topk_probfalse
num_attention_heads16
num_experts_per_tok6
num_hidden_layers28
num_key_value_heads16
pretraining_tp1
rms_norm_eps0.000001
rope_theta10000
scoring_funcsoftmax
tie_word_embeddingsfalse
torch_dtypebfloat16
transformers_version4.36.0
use_cachetrue
vocab_size102400