MiniMax · 2026-04 · 스파스 MoE

MiniMax-M2.7

MiniMax-M2.7은(는) MiniMax가 2026-04에 공개한 그룹화 쿼리 어텐션(GQA) Transformer로, 62개 층, 은닉 차원 3072, 컨텍스트 길이 204,800 토큰을 갖습니다.

레이어 스택

어텐션 ×62 · 레이어 수 62

핵심 사양

연구소MiniMax
공개일2026-04
총 파라미터228.3 B
활성 파라미터10.6 B
컨텍스트204,800 tokens
어텐션GQA (48:8)
레이어 수62
은닉 차원3,072
어텐션 헤드48
어휘 크기200,064
위치 인코딩RoPE
정규화RMSNorm
활성화 함수silu
학습 정밀도fp8
아키텍처 클래스MiniMaxM2ForCausalLM

아키텍처 개요

t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 200,064 → 은닉 차원 3,072 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 어텐션 헤드 48 KV 헤드 8 head dim 128 · RoPE 라우터 E1 E2 E3 E4 E5 E6 E7 E8 +248… 256 전문가 중 top-8 · 토큰당 약 10.6B 파라미터 활성 × 62 Transformer 블록 어텐션 FFN / MoE RMSNorm pre-norm 최종 정규화 · RMSNorm LM head → 어휘 크기 200,064 p p p → 다음 토큰 MTP ×3 → +3 개의 미래 토큰 위치 인코딩 RoPE 학습 정밀도 FP8 컨텍스트 200K tok
동봉된 config.json을 바탕으로 작도 · 62층 / 은닉 3,072 / 컨텍스트 204,800. 도식은 본 사이트의 오리지널입니다.

어텐션

그룹화 쿼리 어텐션(GQA) — 48 q-heads / 8 kv-heads. RoPE θ=5,000,000.

FFN / MoE

스파스 Mixture-of-Experts 모델로, 256개 라우팅 전문가와 top-8 라우팅을 사용하며 토큰당 약 10.6B 파라미터가 활성화됩니다.

설정에는 디코딩 가속을 위한 멀티 토큰 예측(MTP) 층이 3개 포함되어 있습니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

이전 세대 MiniMax-M2.5과의 전 필드 비교
모델MiniMax-M2.7MiniMax-M2.5배수
model_typeminimax_m2minimax_m2
architecturesMiniMaxM2ForCausalLMMiniMaxM2ForCausalLM
hidden_size30723072≈1
num_hidden_layers6262≈1
num_attention_heads4848≈1
num_key_value_heads88≈1
head_dim128128≈1
intermediate_size15361536≈1
hidden_actsilusilu
num_experts_per_tok88≈1
rope_theta50000005000000≈1
max_position_embeddings204800196608×1.04
rms_norm_eps0.0000010.000001≈1
vocab_size200064200064≈1
attn_type_list1×621×62
dtypebfloat16
mtp_transformer_layers11≈1
num_local_experts256256≈1
num_mtp_modules33≈1
qk_norm_typeper_layerper_layer
rotary_dim6464≈1
scoring_funcsigmoidsigmoid
shared_intermediate_size00
tie_word_embeddingsfalsefalse
transformers_version4.46.14.46.1
use_cachetruetrue

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

29 개 필드
architecturesMiniMaxM2ForCausalLM
attn_type_list1×62
dtypebfloat16
head_dim128
hidden_actsilu
hidden_size3072
intermediate_size1536
max_position_embeddings204800
model_typeminimax_m2
mtp_transformer_layers1
num_attention_heads48
num_experts_per_tok8
num_hidden_layers62
num_key_value_heads8
num_local_experts256
num_mtp_modules3
qk_norm_typeper_layer
rms_norm_eps0.000001
rope_theta5000000
rotary_dim64
scoring_funcsigmoid
shared_intermediate_size0
tie_word_embeddingsfalse
transformers_version4.46.1
use_cachetrue
use_mtptrue
use_qk_normtrue
use_routing_biastrue
vocab_size200064