Kimi · 2025-10 · 稀疏 MoE

Kimi Linear 48B A3B

Kimi Linear 48B A3B 是 Kimi 於 2025-10 發布的 多頭潛在注意力(MLA) Transformer,共 27 層,隱藏維度 2304,上下文視窗 262,144 個 token。

層堆疊

注意力 ×27 · 層數 27

關鍵參數

實驗室Kimi
發布時間2025-10
總參數50 B
激活參數2.8 B
上下文262,144 tokens
注意力MLA · kv_lora_rank 512
層數27
隱藏維度2,304
注意力頭32
詞表163,840
位置編碼RoPE
正規化RMSNorm
激活函數silu
訓練精度bf16
架構類別KimiLinearForCausalLM

架構概覽

t₁ t₂ t₃ t₄ 輸入 token Embedding · 詞表 163,840 → 隱藏維度 2,304 Q · 32 Wᴰᴷⱽ ↓ c_KV · 512 kᴿ · RoPE 64 Wᵁᴷ/Wᵁⱽ ↑ ⊕kᴿ Attention KV 缓存/token ≈ 512+64,稠密为 2·2,304 → 约 1/8.0 路由器 E1 E2 E3 E4 E5 E6 E7 E8 +248… 共享专家 ×1 256 专家选 top-8 · 每 token 约激活 2.8B 参数 × 27 Transformer 块 注意力 前饋 / MoE RMSNorm pre-norm 最終正規化 · RMSNorm LM head → 詞表 163,840 p p p → 下一 token 位置編碼 RoPE 訓練精度 BF16 上下文 256K tok
依據隨權重發布的 config.json 繪製 · 27 層 / 寬 2,304 / 上下文 262,144。本圖為本站原創示意圖。

注意力

多頭潛在注意力(MLA). kv_lora_rank=512. RoPE θ=10,000.

前饋 / MoE

它是稀疏混合專家模型:256 個路由專家、top-8 路由;每個 token 約激活 2.8B 參數。

欄位級對比

對比對象為同實驗室的上一代模型;無前代時取結構最相似的模型。倍數欄 = 本模型數值 ÷ 對比模型數值。

與前代 Kimi K2 0905 的全欄位對比
模型Kimi Linear 48B A3BKimi K2 0905倍數
model_typekimi_linearkimi_k2
architecturesKimiLinearForCausalLMDeepseekV3ForCausalLM
hidden_size23047168×0.321
num_hidden_layers2761×0.443
num_attention_heads3264×0.500
num_key_value_heads3264×0.500
head_dim72
intermediate_size921618432×0.500
hidden_actsilusilu
n_routed_experts384
num_experts_per_tok8
n_shared_experts1
moe_intermediate_size10242048×0.500
kv_lora_rank512512≈1
qk_rope_head_dim6464≈1
q_lora_rank1536
rope_theta1000050000×0.200
max_position_embeddings262144
rms_norm_eps0.000010.00001≈1
vocab_size163840163840≈1
torch_dtypebfloat16
num_nextn_predict_layers00
bos_token_id163584163584≈1
dtypebfloat16
eos_token_id163586163585≈1
first_k_dense_replace11≈1

結構最相似的模型

相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。

原始 config 欄位

39 個欄位
architecturesKimiLinearForCausalLM
bos_token_id163584
dtypebfloat16
eos_token_id163586
first_k_dense_replace1
head_dim72
hidden_actsilu
hidden_size2304
initializer_range0.02
intermediate_size9216
kv_lora_rank512
mla_use_nopetrue
model_max_length1048576
model_typekimi_linear
moe_intermediate_size1024
moe_layer_freq1
moe_renormalizetrue
moe_router_activation_funcsigmoid
num_attention_heads32
num_expert_group1
num_experts256
num_experts_per_token8
num_hidden_layers27
num_key_value_heads32
num_nextn_predict_layers0
num_shared_experts1
pad_token_id163839
qk_nope_head_dim128
qk_rope_head_dim64
rms_norm_eps0.00001
rope_theta10000
routed_scaling_factor2.446
tie_word_embeddingsfalse
topk_group1
transformers_version4.57.1
use_cachetrue
use_grouped_topktrue
v_head_dim128
vocab_size163840