MiniMax · 2025-10 · 스파스 MoE

MiniMax-M2

MiniMax-M2은(는) MiniMax가 2025-10에 공개한 그룹화 쿼리 어텐션(GQA) Transformer로, 62개 층, 은닉 차원 3072, 컨텍스트 길이 196,608 토큰을 갖습니다.

레이어 스택

어텐션 ×62 · 레이어 수 62

핵심 사양

연구소MiniMax
공개일2025-10
총 파라미터228.3 B
활성 파라미터10.6 B
컨텍스트196,608 tokens
어텐션GQA (48:8)
레이어 수62
은닉 차원3,072
어텐션 헤드48
어휘 크기200,064
위치 인코딩RoPE
정규화RMSNorm
활성화 함수silu
학습 정밀도fp8
아키텍처 클래스MiniMaxM2ForCausalLM

아키텍처 개요

t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 200,064 → 은닉 차원 3,072 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 어텐션 헤드 48 KV 헤드 8 head dim 128 · RoPE 라우터 E1 E2 E3 E4 E5 E6 E7 E8 +248… 256 전문가 중 top-8 · 토큰당 약 10.6B 파라미터 활성 × 62 Transformer 블록 어텐션 FFN / MoE RMSNorm pre-norm 최종 정규화 · RMSNorm LM head → 어휘 크기 200,064 p p p → 다음 토큰 MTP ×3 → +3 개의 미래 토큰 위치 인코딩 RoPE 학습 정밀도 FP8 컨텍스트 192K tok
동봉된 config.json을 바탕으로 작도 · 62층 / 은닉 3,072 / 컨텍스트 196,608. 도식은 본 사이트의 오리지널입니다.

어텐션

그룹화 쿼리 어텐션(GQA) — 48 q-heads / 8 kv-heads. RoPE θ=5,000,000.

FFN / MoE

스파스 Mixture-of-Experts 모델로, 256개 라우팅 전문가와 top-8 라우팅을 사용하며 토큰당 약 10.6B 파라미터가 활성화됩니다.

설정에는 디코딩 가속을 위한 멀티 토큰 예측(MTP) 층이 3개 포함되어 있습니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

이전 세대 MiniMax-M1과의 전 필드 비교
모델MiniMax-M2MiniMax-M1배수
model_typeminimax_m2minimax
architecturesMiniMaxM2ForCausalLMMiniMaxForCausalLM
hidden_size30726144×0.500
num_hidden_layers6280×0.775
num_attention_heads4864×0.750
num_key_value_heads88≈1
head_dim128128≈1
intermediate_size15369216×0.167
hidden_actsilusilu
num_experts_per_tok82×4.00
rope_theta500000010000000×0.500
max_position_embeddings19660810240000×0.019
rms_norm_eps0.0000010.00001×0.100
vocab_size200064200064≈1
attention_dropout00
attn_type_list1×62
initializer_range0.020.02≈1
layernorm_full_attention_beta1
layernorm_linear_attention_beta1
layernorm_mlp_beta1
mlp_intermediate_size8192
mtp_transformer_layers1
num_local_experts25632×8.00
num_mtp_modules3
output_router_logitsfalsefalse
qk_norm_typeper_layer

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

38 개 필드
architecturesMiniMaxM2ForCausalLM
attention_dropout0
attn_type_list1×62
head_dim128
hidden_actsilu
hidden_size3072
initializer_range0.02
intermediate_size1536
layernorm_full_attention_beta1
layernorm_linear_attention_beta1
layernorm_mlp_beta1
max_position_embeddings196608
mlp_intermediate_size8192
model_typeminimax_m2
mtp_transformer_layers1
num_attention_heads48
num_experts_per_tok8
num_hidden_layers62
num_key_value_heads8
num_local_experts256
num_mtp_modules3
output_router_logitsfalse
qk_norm_typeper_layer
rms_norm_eps0.000001
rope_theta5000000
rotary_dim64
router_aux_loss_coef0.001
router_jitter_noise0
scoring_funcsigmoid
shared_intermediate_size0
shared_moe_modesigmoid
tie_word_embeddingsfalse
transformers_version4.57.1
use_cachetrue
use_mtptrue
use_qk_normtrue
use_routing_biastrue
vocab_size200064