Qwen · 2026-02 · 덴스 · 멀티모달

Qwen3.5 9B Base

Qwen3.5 9B Base은(는) Qwen가 2026-02에 공개한 그룹화 쿼리 어텐션(GQA) Transformer로, 32개 층, 은닉 차원 4096, 컨텍스트 길이 262,144 토큰을 갖습니다.

레이어 스택

선형 ×24 어텐션 ×8 · 레이어 수 32

핵심 사양

연구소Qwen
공개일2026-02
총 파라미터7.9 B
컨텍스트262,144 tokens
어텐션GQA (16:4)
레이어 수32
은닉 차원4,096
어텐션 헤드16
어휘 크기248,320
위치 인코딩learned/absolute
정규화RMSNorm
활성화 함수silu
학습 정밀도bf16
아키텍처 클래스Qwen3_5ForConditionalGeneration

아키텍처 개요

비전 입력 → 토큰 t₁ t₂ t₃ t₄ 입력 토큰 Embedding · 어휘 크기 248,320 → 은닉 차원 4,096 Q1 Q2 Q3 Qn KV1 KV2 KV3 KVn 어텐션 헤드 16 KV 헤드 4 head dim 256 · learned/absolute FFN · SwiGLU FFN 차원 12,288 × 32 Transformer 블록 어텐션 FFN / MoE RMSNorm pre-norm 최종 정규화 · RMSNorm LM head → 어휘 크기 248,320 p p p → 다음 토큰 MTP ×1 → +1 개의 미래 토큰 위치 인코딩 learned/absolute 학습 정밀도 BF16 컨텍스트 256K tok Vision ⇢ token
동봉된 config.json을 바탕으로 작도 · 32층 / 은닉 4,096 / 컨텍스트 262,144. 도식은 본 사이트의 오리지널입니다.

어텐션

그룹화 쿼리 어텐션(GQA) — 16 q-heads / 4 kv-heads.

FFN / MoE

덴스 모델로, 전체 7.9B 파라미터가 모든 토큰 계산에 참여합니다.

설정에는 디코딩 가속을 위한 멀티 토큰 예측(MTP) 층이 1개 포함되어 있습니다.

필드 단위 비교

같은 연구소의 이전 세대 모델과 비교합니다. 없으면 구조가 가장 유사한 모델과 비교. 배수 열 = 본 모델 ÷ 비교 대상.

이전 세대 Qwen3.5 9B과의 전 필드 비교
모델Qwen3.5 9B BaseQwen3.5 9B배수
model_typeqwen3_5qwen3_5
architecturesQwen3_5ForConditionalGenerationQwen3_5ForConditionalGeneration
hidden_size40964096≈1
num_hidden_layers3232≈1
num_attention_heads1616≈1
num_key_value_heads44≈1
head_dim256256≈1
intermediate_size1228812288≈1
hidden_actsilusilu
max_position_embeddings262144262144≈1
rms_norm_eps0.0000010.000001≈1
vocab_size248320248320≈1
image_token_id248056248056≈1
tie_word_embeddingsfalsefalse
transformers_version4.57.0.dev04.57.0.dev0
video_token_id248057248057≈1
vision_end_token_id248054248054≈1
vision_start_token_id248053248053≈1
attention_biasfalsefalse
attention_dropout00
attn_output_gatetruetrue
dtypebfloat16bfloat16
eos_token_id248044248044≈1
full_attention_interval44≈1
initializer_range0.020.02≈1
layer_typeslinear_attention×24 + full_attention×8linear_attention×24 + full_attention×8

구조가 가장 유사한 모델

유사도는 0(공통 범주 특징 없음)에서 1(구조 프로파일 완전 일치) 사이의 값입니다.

config.json 전체 필드

35 개 필드
architecturesQwen3_5ForConditionalGeneration
image_token_id248056
model_typeqwen3_5
tie_word_embeddingsfalse
transformers_version4.57.0.dev0
video_token_id248057
vision_end_token_id248054
vision_start_token_id248053
attention_biasfalse
attention_dropout0
attn_output_gatetrue
dtypebfloat16
eos_token_id248044
full_attention_interval4
head_dim256
hidden_actsilu
hidden_size4096
initializer_range0.02
intermediate_size12288
layer_typeslinear_attention×24 + full_attention×8
linear_conv_kernel_dim4
linear_key_head_dim128
linear_num_key_heads16
linear_num_value_heads32
linear_value_head_dim128
max_position_embeddings262144
mtp_num_hidden_layers1
mtp_use_dedicated_embeddingsfalse
num_attention_heads16
num_hidden_layers32
num_key_value_heads4
rms_norm_eps0.000001
use_cachetrue
vocab_size248320
mamba_ssm_dtypefloat32