Modèles multimodaux
Les modèles à poids ouverts acceptant les images se multiplient. Cette page recense tous les modèles multimodaux du corpus et les preuves de config qui les identifient.
Critère (factuel, mécanique) : le config.json livré contient des champs liés à la vision — ids de tokens image/vision, réglages d’encodeur visuel ou champs de patchs d’image. Aucune autre déduction.
| Modèle | Laboratoire | Publication | Paramètres | MoE | Attention | Preuve dans le config |
|---|---|---|---|---|---|---|
| Step-3 | StepFun | 2025-07 | 321 Md | MoE épars | MHA | im_end_token im_patch_token im_start_token +3 |
| Hunyuan 7B | Hunyuan | 2025-08 | 7.8 Md | Dense | GQA | im_end_id im_newline_id im_start_id |
| Kimi K2.5 | Kimi | 2026-02 | 1,040.2 Md | MoE épars | MLA | use_unified_vision_chunk |
| Qwen3.5 122B A10B | Qwen | 2026-02 | 119.9 Md | MoE épars | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 27B | Qwen | 2026-02 | 23.7 Md | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 35B A3B | Qwen | 2026-02 | 33.9 Md | MoE épars | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 397B A17B | Qwen | 2026-02 | 392.6 Md | MoE épars | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 9B | Qwen | 2026-02 | 7.9 Md | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.5 9B Base | Qwen | 2026-02 | 7.9 Md | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Kimi K2.6 | Kimi | 2026-04 | 1,040.2 Md | MoE épars | MLA | use_unified_vision_chunk |
| Qwen3.6 27B | Qwen | 2026-04 | 23.7 Md | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.6 35B A3B | Qwen | 2026-04 | 33.9 Md | MoE épars | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Hunyuan-TurboS 7B | Hunyuan | 2026-05 | 7.8 Md | Dense | GQA | im_end_id im_newline_id im_start_id |
| Step-3.7-Flash | StepFun | 2026-05 | 198 Md | MoE épars | MHA | im_end_token im_patch_token im_start_token +5 |
| MiniMax-M3 | MiniMax | 2026-06 | 443.4 Md | MoE épars | GQA | image_grid_pinpoints image_seq_length image_token_index +3 |
| MiniMax-M3 MXFP8 | MiniMax | 2026-06 | 443.4 Md | MoE épars | GQA | image_grid_pinpoints image_seq_length image_token_index +3 |
| Kimi K3 | Kimi | 2026-07 | 2,780 Md | MoE épars | MLA | image_placeholder |
| GLM-5.3-Flash | GLM | 2026-08 | 328.9 Md | MoE épars | MLA | image_token_id image_start_token_id image_end_token_id |
| Qwen3.8 27B | Qwen | 2026-08 | 23.7 Md | Dense | GQA | image_token_id vision_end_token_id vision_start_token_id |
| Qwen3.8-Flash-Next | Qwen | 2026-08 | 123.6 Md | MoE épars | GQA | image_token_id vision_end_token_id vision_start_token_id |
La liste complète des champs figure sur chaque page de modèle ; le tableau montre les premiers champs à titre de preuve.