Qwen · 2026-04 · 덴스 · 멀티모달

Qwen3.6 27B

Qwen3.6 27B은(는) Qwen가 2026-04에 공개한 그룹화 쿼리 어텐션(GQA) Transformer로, 64개 층, 은닉 차원 5120, 컨텍스트 길이 262,144 토큰을 갖습니다.

레이어 스택

선형 ×48 어텐션 ×16 · 레이어 수 64

핵심 사양

연구소Qwen
공개일2026-04
총 파라미터23.7 B
컨텍스트262,144 tokens
어텐션GQA (24:4)
레이어 수64
은닉 차원5,120
어텐션 헤드24
어휘 크기248,320
위치 인코딩RoPE
정규화RMSNorm
활성화 함수silu
학습 정밀도bf16
아키텍처 클래스Qwen3_5ForConditionalGeneration

아키텍처 개요

비전 입력 → 토큰 t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 248,320 → 은닉 차원 5,120 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 어텐션 헤드 24 KV 헤드 4 head dim 256 · RoPE FFN · SwiGLU FFN 차원 17,408 × 64 Transformer 블록 어텐션 FFN / MoE RMSNorm pre-norm 최종 정규화 · RMSNorm LM head → 어휘 크기 248,320 p p p → 다음 토큰 MTP ×1 → +1 개의 미래 토큰 위치 인코딩 RoPE 학습 정밀도 BF16 컨텍스트 256K tok Vision ⇢ token
동봉된 config.json을 바탕으로 작도 · 64층 / 은닉 5,120 / 컨텍스트 262,144. 도식은 본 사이트의 오리지널입니다.

어텐션

그룹화 쿼리 어텐션(GQA) — 24 q-heads / 4 kv-heads.

FFN / MoE

덴스 모델로, 전체 23.7B 파라미터가 모든 토큰 계산에 참여합니다.

설정에는 디코딩 가속을 위한 멀티 토큰 예측(MTP) 층이 1개 포함되어 있습니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

이전 세대 Qwen3.5 9B Base과의 전 필드 비교
모델Qwen3.6 27BQwen3.5 9B Base배수
model_typeqwen3_5qwen3_5
architecturesQwen3_5ForConditionalGenerationQwen3_5ForConditionalGeneration
hidden_size51204096×1.25
num_hidden_layers6432×2.00
num_attention_heads2416×1.50
num_key_value_heads44≈1
head_dim256256≈1
intermediate_size1740812288×1.42
hidden_actsilusilu
max_position_embeddings262144262144≈1
rms_norm_eps0.0000010.000001≈1
vocab_size248320248320≈1
image_token_id248056248056≈1
language_model_onlyfalse
tie_word_embeddingsfalsefalse
transformers_version4.57.14.57.0.dev0
video_token_id248057248057≈1
vision_end_token_id248054248054≈1
vision_start_token_id248053248053≈1
attention_biasfalsefalse
attention_dropout00
attn_output_gatetruetrue
bos_token_id248044
dtypebfloat16bfloat16
eos_token_id248044248044≈1
full_attention_interval44≈1

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

39 개 필드
architecturesQwen3_5ForConditionalGeneration
image_token_id248056
language_model_onlyfalse
model_typeqwen3_5
tie_word_embeddingsfalse
transformers_version4.57.1
video_token_id248057
vision_end_token_id248054
vision_start_token_id248053
attention_biasfalse
attention_dropout0
attn_output_gatetrue
bos_token_id248044
dtypebfloat16
eos_token_id248044
full_attention_interval4
head_dim256
hidden_actsilu
hidden_size5120
initializer_range0.02
intermediate_size17408
layer_typeslinear_attention×48 + full_attention×16
linear_conv_kernel_dim4
linear_key_head_dim128
linear_num_key_heads16
linear_num_value_heads48
linear_value_head_dim128
mamba_ssm_dtypefloat32
max_position_embeddings262144
mtp_num_hidden_layers1
mtp_use_dedicated_embeddingsfalse
num_attention_heads24
num_hidden_layers64
num_key_value_heads4
output_gate_typeswish
partial_rotary_factor0.25
rms_norm_eps0.000001
use_cachetrue
vocab_size248320