Multimodal models
A growing share of open-weight models accept images as well as text. This page lists every multimodal model in the corpus and the config evidence that identifies it.
Criterion (factual, mechanical): the shipped config.json contains vision-related keys — image/vision token ids, vision encoder settings or image patch fields. Nothing else is inferred.
| Model | Family | Released | Params | MoE | Attention | Config evidence |
|---|---|---|---|---|---|---|
| Step-3 | StepFun | 2025-07 | 321 B | Sparse MoE | MHA | im_end_token im_patch_token im_start_token +3 |
| Hunyuan 7B | Hunyuan | 2025-08 | 7.8 B | Dense | GQA | im_end_id im_newline_id im_start_id |
| Kimi K2.5 | Kimi | 2026-02 | 1,040.2 B | Sparse MoE | MLA | use_unified_vision_chunk |
| Qwen3.5 122B A10B | Qwen | 2026-02 | 119.9 B | Sparse MoE | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 27B | Qwen | 2026-02 | 23.7 B | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 35B A3B | Qwen | 2026-02 | 33.9 B | Sparse MoE | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 397B A17B | Qwen | 2026-02 | 392.6 B | Sparse MoE | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 9B | Qwen | 2026-02 | 7.9 B | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 9B Base | Qwen | 2026-02 | 7.9 B | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Kimi K2.6 | Kimi | 2026-04 | 1,040.2 B | Sparse MoE | MLA | use_unified_vision_chunk |
| Qwen3.6 27B | Qwen | 2026-04 | 23.7 B | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.6 35B A3B | Qwen | 2026-04 | 33.9 B | Sparse MoE | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Hunyuan-TurboS 7B | Hunyuan | 2026-05 | 7.8 B | Dense | GQA | im_end_id im_newline_id im_start_id |
| Step-3.7-Flash | StepFun | 2026-05 | 198 B | Sparse MoE | MHA | im_end_token im_patch_token im_start_token +5 |
| MiniMax-M3 | MiniMax | 2026-06 | 443.4 B | Sparse MoE | GQA | image_grid_pinpoints image_seq_length image_token_index +3 |
| MiniMax-M3 MXFP8 | MiniMax | 2026-06 | 443.4 B | Sparse MoE | GQA | image_grid_pinpoints image_seq_length image_token_index +3 |
| Kimi K3 | Kimi | 2026-07 | 2,780 B | Sparse MoE | MLA | image_placeholder |
| GLM-5.3-Flash | GLM | 2026-08 | 328.9 B | Sparse MoE | MLA | image_token_id image_start_token_id image_end_token_id |
| Qwen3.8 27B | Qwen | 2026-08 | 23.7 B | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.8-Flash-Next | Qwen | 2026-08 | 123.6 B | Sparse MoE | GQA | image_token_id vision_end_token_id vision_start_token_id |
The full key list is on each model page; the table shows the first few fields as evidence.