Modelli multimodali
Sempre più modelli aperti accettano immagini oltre al testo. Questa pagina elenca ogni modello multimodale del corpus e le prove di config che lo identificano.
Criterio (fattuale, meccanico): il config.json distribuito contiene campi legati alla visione — id di token immagine/vision, impostazioni di encoder visivi o campi di patch immagine. Nessun’altra inferenza.
| Modello | Laboratorio | Pubblicazione | Parametri | MoE | Attention | Prove dal config |
|---|---|---|---|---|---|---|
| Step-3 | StepFun | 2025-07 | 321 mld | MoE sparsa | MHA | im_end_token im_patch_token im_start_token +3 |
| Hunyuan 7B | Hunyuan | 2025-08 | 7.8 mld | Densa | GQA | im_end_id im_newline_id im_start_id |
| Kimi K2.5 | Kimi | 2026-02 | 1,040.2 mld | MoE sparsa | MLA | use_unified_vision_chunk |
| Qwen3.5 122B A10B | Qwen | 2026-02 | 119.9 mld | MoE sparsa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 27B | Qwen | 2026-02 | 23.7 mld | Densa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 35B A3B | Qwen | 2026-02 | 33.9 mld | MoE sparsa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 397B A17B | Qwen | 2026-02 | 392.6 mld | MoE sparsa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 9B | Qwen | 2026-02 | 7.9 mld | Densa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 9B Base | Qwen | 2026-02 | 7.9 mld | Densa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Kimi K2.6 | Kimi | 2026-04 | 1,040.2 mld | MoE sparsa | MLA | use_unified_vision_chunk |
| Qwen3.6 27B | Qwen | 2026-04 | 23.7 mld | Densa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.6 35B A3B | Qwen | 2026-04 | 33.9 mld | MoE sparsa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Hunyuan-TurboS 7B | Hunyuan | 2026-05 | 7.8 mld | Densa | GQA | im_end_id im_newline_id im_start_id |
| Step-3.7-Flash | StepFun | 2026-05 | 198 mld | MoE sparsa | MHA | im_end_token im_patch_token im_start_token +5 |
| MiniMax-M3 | MiniMax | 2026-06 | 443.4 mld | MoE sparsa | GQA | image_grid_pinpoints image_seq_length image_token_index +3 |
| MiniMax-M3 MXFP8 | MiniMax | 2026-06 | 443.4 mld | MoE sparsa | GQA | image_grid_pinpoints image_seq_length image_token_index +3 |
| Kimi K3 | Kimi | 2026-07 | 2,780 mld | MoE sparsa | MLA | image_placeholder |
| GLM-5.3-Flash | GLM | 2026-08 | 328.9 mld | MoE sparsa | MLA | image_token_id image_start_token_id image_end_token_id |
| Qwen3.8 27B | Qwen | 2026-08 | 23.7 mld | Densa | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.8-Flash-Next | Qwen | 2026-08 | 123.6 mld | MoE sparsa | GQA | image_token_id vision_end_token_id vision_start_token_id |
L’elenco completo dei campi è nella pagina di ogni modello; la tabella mostra i primi campi come prova.