Qwen · 2026-08 · MoE sparsa · Multimodale

Qwen3.8-Flash-Next

Qwen3.8-Flash-Next è un Transformer a attention grouped-query (GQA) pubblicato da Qwen nel 2026-08, con 48 strati, dimensione nascosta 2560 e una finestra di contesto di 262,144 token.

Pila di strati

Lineare ×36 Attention ×12 · Strati 48

Dati chiave

LaboratorioQwen
Pubblicazione2026-08
Parametri123.6 mld
Attivi5.1 mld
Contesto262,144 tokens
AttentionGQA (24:2)
Strati48
Dim. nascosta2,560
Teste di attention24
Vocabolario248,320
Codifica posizionaleRoPE
NormalizzazioneRMSNorm
Attivazionesilu
Precisionebf16
Classe architetturaleQwen4ExpForConditionalGeneration

Panoramica dell'architettura

Ingresso vision → token t₁ t₂ t₃ t₄ token di ingresso Embedding · Vocabolario 248,320 → Dim. nascosta 2,560 Q1 Q2 Q3 Qn KV1 KV2 Teste di attention 24 Teste KV 2 head dim 256 · RoPE Router E1 E2 E3 E4 E5 E6 E7 E8 +504… Esperto condiviso ×1 top-10 su 512 esperti · ≈ 5.1mld parametri attivi per token × 48 blocco transformer Attention FFN / MoE RMSNorm pre-norm Normalizzazione finale · RMSNorm LM head → Vocabolario 248,320 p p p → token successivo MTP ×1 → +1 token futuri Codifica posizionale RoPE Precisione BF16 Contesto 256K tok Vision ⇢ token
Disegnato dal config.json distribuito · 48 strati / larghezza 2,560 / contesto 262,144. Schema originale di questo atlante.

Attention

attention grouped-query (GQA) — 24 q-heads / 2 kv-heads.

FFN / MoE

È un mixture-of-experts sparso con 512 esperti instradati e routing top-10; circa 5.1 milioni di parametri sono attivi per token.

La configurazione include 1 strati extra di predizione multi-token (MTP) usati per accelerare il decodice.

Confronto campo per campo

Confronto con il modello precedente dello stesso laboratorio; in assenza, col modello strutturalmente più vicino. La colonna rapporto = questo modello ÷ modello di confronto.

Confronto completo con il predecessore Qwen3.8 27B
ModelloQwen3.8-Flash-NextQwen3.8 27BRapporto
model_typeqwen4_expqwen3_5
architecturesQwen4ExpForConditionalGenerationQwen3_5ForConditionalGeneration
hidden_size25605120×0.500
num_hidden_layers4864×0.750
num_attention_heads2424≈1
num_key_value_heads24×0.500
head_dim256256≈1
intermediate_size17408
hidden_actsilusilu
num_experts_per_tok10
moe_intermediate_size640
max_position_embeddings262144262144≈1
rms_norm_eps0.0000010.000001≈1
vocab_size248320248320≈1
image_token_id248056248056≈1
language_model_onlyfalsefalse
tie_word_embeddingsfalsefalse
transformers_version5.8.0.dev05.8.0.dev0
video_token_id248057248057≈1
vision_end_token_id248054248054≈1
vision_start_token_id248053248053≈1
attention_biasfalsefalse
attention_dropout00
bos_token_id248044248044≈1
dtypebfloat16bfloat16
eos_token_id248044248044≈1

Architetture più simili

I valori di similarità vanno da 0 (nessuna caratteristica categoriale condivisa) a 1 (profili identici).

Campi grezzi del config.json

58 campi
architecturesQwen4ExpForConditionalGeneration
image_token_id248056
language_model_onlyfalse
model_typeqwen4_exp
tie_word_embeddingsfalse
transformers_version5.8.0.dev0
video_token_id248057
vision_end_token_id248054
vision_start_token_id248053
attention_biasfalse
attention_dropout0
bos_token_id248044
dtypebfloat16
eos_token_id248044
full_attention_interval4
hc_count4
hc_lowrank320
head_dim256
heads_per_ngram8
hidden_actsilu
hidden_size2560
indexer_budget2048
indexer_compress_ratio4
indexer_head_dim128
indexer_kv_heads1
indexer_n_heads4
initializer_range0.02
layer_typeslinear_attention×36 + full_attention×12
linear_conv_kernel_dim4
linear_key_head_dim128
linear_num_key_heads16
linear_num_value_heads48
linear_value_head_dim128
make_ngram_vocab_size_divisible_by128
mamba_ssm_dtypefloat32
max_position_embeddings262144
moe_intermediate_size640
mtp_num_hidden_layers1
mtp_use_dedicated_embeddingsfalse
ngram_size3
ngram_vocab_size_base20000000
num_attention_heads24
num_experts512
num_experts_per_tok10
num_hidden_layers48
num_key_value_heads2
output_gate_typesigmoid
output_router_logitsfalse
partial_rotary_factor0.25
ple_conv_kernel_size4
ple_embed_dim2560
ple_layer_ids2×1
rms_norm_eps0.000001
router_aux_loss_coef0.001
shared_expert_intermediate_size640
split_ngram_parts128
use_cachetrue
vocab_size248320