Évolution des architectures

Les techniques d'architecture n'apparaissent pas au hasard : elles se diffusent de laboratoire en laboratoire. Cette page retrace deux courbes — l'évolution de l'attention elle-même, et la chronologie d'adoption des opérateurs qui rendent les LLM modernes entraînables et économiques à servir.

L'attention : de MHA au linéaire hybride

L'attention multi-tête (MHA) calcule une paire de têtes clé–valeur par tête de requête. Le multi-query (MQA) partage une seule tête KV entre toutes les requêtes ; le grouped-query (GQA) généralise cela à quelques têtes partagées et est devenu le standard des modèles denses après Llama 2 70B. L'attention latente multi-tête (MLA), introduite avec DeepSeek-V2, compresse les clés et les valeurs dans un vecteur latent de rang faible. Les conceptions hybrides les plus récentes entrelacent des couches d'attention linéaire avec une minorité de couches d'attention complète.

attention multi-tête (MHA) · 10

La formulation originale : une paire de têtes clé–valeur par tête de requête. Standard de GPT-2 à la plupart des modèles denses antérieurs à 2023.

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

attention multi-query (MQA) · 3

Une seule tête KV partagée sert toutes les têtes de requête — économies agressives de cache KV au prix d’une certaine qualité ; rare dans les modèles ouverts de pointe.

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1

attention latente multi-tête (MLA) · 21

Les clés et valeurs sont compressées dans un vecteur latent de rang faible, réduisant drastiquement le cache KV ; introduite avec DeepSeek-V2.

DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview

Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

attention linéaire hybride · 0

Une minorité de couches d’attention complète entrecoupées de couches d’attention linéaire, échangeant le coût long-contexte contre une mémoire quasi constante.

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full couches d’attention linéaire entrecoupées de quelques couches d’attention complète

Adoption des opérateurs

Chaque ligne correspond à une technique ; l'année indiquée est celle de la première publication en poids ouverts dans le corpus.

Attention / ThèmeModèlePremier adoptant en poids ouverts
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)