Évolution des architectures
Les techniques d'architecture n'apparaissent pas au hasard : elles se diffusent de laboratoire en laboratoire. Cette page retrace deux courbes — l'évolution de l'attention elle-même, et la chronologie d'adoption des opérateurs qui rendent les LLM modernes entraînables et économiques à servir.
L'attention : de MHA au linéaire hybride
L'attention multi-tête (MHA) calcule une paire de têtes clé–valeur par tête de requête. Le multi-query (MQA) partage une seule tête KV entre toutes les requêtes ; le grouped-query (GQA) généralise cela à quelques têtes partagées et est devenu le standard des modèles denses après Llama 2 70B. L'attention latente multi-tête (MLA), introduite avec DeepSeek-V2, compresse les clés et les valeurs dans un vecteur latent de rang faible. Les conceptions hybrides les plus récentes entrelacent des couches d'attention linéaire avec une minorité de couches d'attention complète.
attention multi-tête (MHA) · 10
La formulation originale : une paire de têtes clé–valeur par tête de requête. Standard de GPT-2 à la plupart des modèles denses antérieurs à 2023.
GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash
attention multi-query (MQA) · 3
Une seule tête KV partagée sert toutes les têtes de requête — économies agressives de cache KV au prix d’une certaine qualité ; rare dans les modèles ouverts de pointe.
attention groupée (GQA) · 46
Quelques têtes KV partagées entre groupes de têtes de requête. Le standard des modèles ouverts denses depuis Llama 2 70B.
Llama 2 70B Mistral 7B ChatGLM3 6B Mixtral 8x22B GLM-4 9B Qwen2 72B Llama 3.1 70B Llama 3.1 8B Qwen2.5 72B Qwen2.5 7B MiniMax-Text-01 Qwen3 0.6B Qwen3 235B A22B Qwen3 30B A3B Qwen3 32B Qwen3 8B MiniMax-M1 GLM-4.5 GLM-4.5-Air Hunyuan 7B GPT-OSS 120B GPT-OSS 20B Qwen3-Next 80B A3B GLM-4.6 MiniMax-M2 Qwen3-Coder-Next MiniMax-M2.5 Qwen3.5 122B A10B Qwen3.5 27B Qwen3.5 35B A3B Qwen3.5 397B A17B Qwen3.5 9B Qwen3.5 9B Base Hunyuan 3 Preview Hunyuan 3 Preview Base MiniMax-M2.7 Qwen3.6 27B Qwen3.6 35B A3B Hunyuan-TurboS 30B A3B Hunyuan-TurboS 7B MiniMax-M3 MiniMax-M3 MXFP8 Hunyuan 3 Qwen3.8 2.4T A95B Qwen3.8 27B Qwen3.8-Flash-Next
attention latente multi-tête (MLA) · 21
Les clés et valeurs sont compressées dans un vecteur latent de rang faible, réduisant drastiquement le cache KV ; introduite avec DeepSeek-V2.
DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview
attention linéaire hybride · 0
Une minorité de couches d’attention complète entrecoupées de couches d’attention linéaire, échangeant le coût long-contexte contre une mémoire quasi constante.
Adoption des opérateurs
Chaque ligne correspond à une technique ; l'année indiquée est celle de la première publication en poids ouverts dans le corpus.
| Attention / Thème | Modèle | Premier adoptant en poids ouverts |
|---|---|---|
| MHA | 10 | GPT-2 (2019-02) |
| GQA | 46 | Llama 2 70B (2023-07) |
| MLA | 21 | DeepSeek-V2 (2024-05) |
| MQA | 3 | DeepSeek-V4-Flash (2026-04) |
| SWA | 12 | Mistral 7B (2023-09) |
| Linear attention (hybrid) | 0 | — |
| MoE | 55 | DeepSeekMoE 16B (2024-01) |
| RoPE | 58 | Mistral 7B (2023-09) |
| YaRN long-context | 0 | — |
| RMSNorm | 73 | LLaMA 1 7B (2023-02) |
| SwiGLU / SiLU | 70 | LLaMA 1 7B (2023-02) |
| Multi-Token Prediction | 39 | DeepSeek-V3 (2024-12) |
| FP8 training | 18 | DeepSeek-V3 (2024-12) |