MiniMax · 2025-01 · 稀疏 MoE

MiniMax-Text-01

MiniMax-Text-01 是 MiniMax 於 2025-01 發布的 分組查詢注意力(GQA) Transformer,共 80 層,隱藏維度 6144,上下文視窗 10,240,000 個 token。

層堆疊

线性 ×70 注意力 ×10 · 層數 80

關鍵參數

實驗室MiniMax
發布時間2025-01
總參數456 B
激活參數45.9 B
上下文10,240,000 tokens
注意力GQA (64:8)
層數80
隱藏維度6,144
注意力頭64
詞表200,064
位置編碼RoPE
正規化RMSNorm
激活函數silu
訓練精度bf16
架構類別MiniMaxForCausalLM

架構概覽

t₁ t₂ t₃ t₄ 輸入 token Embedding · 詞表 200,064 → 隱藏維度 6,144 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 注意力頭 64 KV 頭 8 head dim 128 · RoPE 路由器 E1 E2 E3 E4 E5 E6 E7 E8 +24… 32 专家选 top-2 · 每 token 约激活 45.9B 参数 × 80 Transformer 块 注意力 前饋 / MoE RMSNorm pre-norm 最終正規化 · RMSNorm LM head → 詞表 200,064 p p p → 下一 token 位置編碼 RoPE 訓練精度 BF16 上下文 10000K tok
依據隨權重發布的 config.json 繪製 · 80 層 / 寬 6,144 / 上下文 10,240,000。本圖為本站原創示意圖。

注意力

分組查詢注意力(GQA) — 64 q-heads / 8 kv-heads. RoPE θ=10,000,000.

前饋 / MoE

它是稀疏混合專家模型:32 個路由專家、top-2 路由;每個 token 約激活 45.9B 參數。

欄位級對比

對比對象為同實驗室的上一代模型;無前代時取結構最相似的模型。倍數欄 = 本模型數值 ÷ 對比模型數值。

與最相似 MiniMax-M1 的全欄位對比
模型MiniMax-Text-01MiniMax-M1倍數
model_typeminimaxminimax
architecturesMiniMaxForCausalLMMiniMaxForCausalLM
hidden_size61446144≈1
num_hidden_layers8080≈1
num_attention_heads6464≈1
num_key_value_heads88≈1
head_dim128128≈1
intermediate_size92169216≈1
hidden_actsilusilu
num_experts_per_tok22≈1
rope_theta1000000010000000≈1
max_position_embeddings1024000010240000≈1
rms_norm_eps0.000010.00001≈1
vocab_size200064200064≈1
attention_dropout00
layer_typeslinear_attention×70 + full_attention×10linear_attention×70 + full_attention×10
initializer_range0.020.02≈1
full_attn_alpha_factor3.55655882007784553.5565588200778455≈1
full_attn_beta_factor11≈1
linear_attn_alpha_factor3.55655882007784553.5565588200778455≈1
linear_attn_beta_factor11≈1
mlp_alpha_factor3.55655882007784553.5565588200778455≈1
mlp_beta_factor11≈1
num_local_experts3232≈1
output_router_logitsfalsefalse
postnormtruetrue

結構最相似的模型

相似度取值範圍 0(無共同類別特徵)到 1(結構輪廓完全一致)。

原始 config 欄位

34 個欄位
architecturesMiniMaxForCausalLM
attention_dropout0
layer_typeslinear_attention×70 + full_attention×10
head_dim128
hidden_actsilu
hidden_size6144
initializer_range0.02
intermediate_size9216
full_attn_alpha_factor3.5565588200778455
full_attn_beta_factor1
linear_attn_alpha_factor3.5565588200778455
linear_attn_beta_factor1
mlp_alpha_factor3.5565588200778455
mlp_beta_factor1
max_position_embeddings10240000
model_typeminimax
num_attention_heads64
num_experts_per_tok2
num_hidden_layers80
num_key_value_heads8
num_local_experts32
output_router_logitsfalse
postnormtrue
rms_norm_eps0.00001
rope_theta10000000
rotary_dim64
router_aux_loss_coef0.001
router_jitter_noise0
shared_intermediate_size0
shared_moe_modesigmoid
tie_word_embeddingsfalse
transformers_version4.45.2
use_cachetrue
vocab_size200064