Kimi · 2025-10 · スパースMoE

Kimi Linear 48B A3B

Kimi Linear 48B A3B は Kimi が 2025-10 に公開した マルチヘッド潜在注意(MLA) Transformer です。27 層、隠れ次元 2304、コンテキスト長 262,144 トークン。

層スタック

注意機構 ×27 · 層数 27

主要スペック

開発元Kimi
公開日2025-10
総パラメータ50 B
活性パラメータ2.8 B
コンテキスト262,144 tokens
注意機構MLA · kv_lora_rank 512
層数27
隠れ次元2,304
注意ヘッド32
語彙数163,840
位置エンコーディングRoPE
正規化RMSNorm
活性化関数silu
学習精度bf16
アーキテクチャクラスKimiLinearForCausalLM

アーキテクチャ概要

t₁ t₂ t₃ t₄ 入力トークン Embedding · 語彙数 163,840 → 隠れ次元 2,304 Q · 32 Wᴰᴷⱽ ↓ c_KV · 512 kᴿ · RoPE 64 Wᵁᴷ/Wᵁⱽ ↑ ⊕kᴿ Attention KV キャッシュ/トークン ≈ 512+64(デンス 2·2,304 → 約 1/8.0) ルーター E1 E2 E3 E4 E5 E6 E7 E8 +248… 共有エキスパート ×1 256 エキスパートから top-8 · トークンごとに約 2.8B パラメータ活性 × 27 Transformer ブロック 注意機構 FFN / MoE RMSNorm pre-norm 最終正規化 · RMSNorm LM head → 語彙数 163,840 p p p → 次のトークン 位置エンコーディング RoPE 学習精度 BF16 コンテキスト 256K tok
同梱の config.json に基づき作図 · 27 層 / 隠れ次元 2,304 / コンテキスト 262,144。図は本サイトのオリジナルです。

注意機構

マルチヘッド潜在注意(MLA). kv_lora_rank=512. RoPE θ=10,000.

FFN / MoE

スパースなMixture-of-Expertsモデルで、256 個のルーティングエキスパートと top-8 ルーティングを持ち、トークンごとに約 2.8B のパラメータが活性化します。

フィールド単位の比較

同一開発元の前世代モデルと比較します。前世代がない場合は構造最相似モデルと比較。倍数欄 = 本モデル ÷ 比較対象。

前世代 Kimi K2 0905 との全フィールド比較
モデルKimi Linear 48B A3BKimi K2 0905倍数
model_typekimi_linearkimi_k2
architecturesKimiLinearForCausalLMDeepseekV3ForCausalLM
hidden_size23047168×0.321
num_hidden_layers2761×0.443
num_attention_heads3264×0.500
num_key_value_heads3264×0.500
head_dim72
intermediate_size921618432×0.500
hidden_actsilusilu
n_routed_experts384
num_experts_per_tok8
n_shared_experts1
moe_intermediate_size10242048×0.500
kv_lora_rank512512≈1
qk_rope_head_dim6464≈1
q_lora_rank1536
rope_theta1000050000×0.200
max_position_embeddings262144
rms_norm_eps0.000010.00001≈1
vocab_size163840163840≈1
torch_dtypebfloat16
num_nextn_predict_layers00
bos_token_id163584163584≈1
dtypebfloat16
eos_token_id163586163585≈1
first_k_dense_replace11≈1

構造が最も近いモデル

類似度は 0(共通のカテゴリ特徴なし)から 1(構造プロファイルが完全に一致)の範囲です。

config.json の全フィールド

39 フィールド
architecturesKimiLinearForCausalLM
bos_token_id163584
dtypebfloat16
eos_token_id163586
first_k_dense_replace1
head_dim72
hidden_actsilu
hidden_size2304
initializer_range0.02
intermediate_size9216
kv_lora_rank512
mla_use_nopetrue
model_max_length1048576
model_typekimi_linear
moe_intermediate_size1024
moe_layer_freq1
moe_renormalizetrue
moe_router_activation_funcsigmoid
num_attention_heads32
num_expert_group1
num_experts256
num_experts_per_token8
num_hidden_layers27
num_key_value_heads32
num_nextn_predict_layers0
num_shared_experts1
pad_token_id163839
qk_nope_head_dim128
qk_rope_head_dim64
rms_norm_eps0.00001
rope_theta10000
routed_scaling_factor2.446
tie_word_embeddingsfalse
topk_group1
transformers_version4.57.1
use_cachetrue
use_grouped_topktrue
v_head_dim128
vocab_size163840