Architekturevolution

Architekturtechniken entstehen nicht zufällig: Sie diffundieren von Labor zu Labor. Diese Seite zeichnet zwei Kurven nach — die Evolution der Attention selbst und die Adoptionszeitleiste der Operatoren, die moderne LLMs trainierbar und günstig im Betrieb machen.

Attention: von MHA zum hybriden Linearen

Multi-Head-Attention (MHA) berechnet ein Key-Value-Head-Paar pro Query-Head. Multi-Query (MQA) teilt einen einzigen KV-Head über alle Queries; Grouped-Query (GQA) verallgemeinert dies auf wenige geteilte Köpfe und wurde nach Llama 2 70B zum Standard für dichte Modelle. Multi-Head-Latent-Attention (MLA), eingeführt mit DeepSeek-V2, komprimiert Keys und Values in einen latenten Vektor niedrigen Rangs. Neueste hybride Entwürfe kombinieren lineare Attention-Schichten mit einer Minderheit voller Attention-Schichten.

Multi-Head-Attention (MHA) · 10

Die ursprüngliche Form: ein Key-Value-Head-Paar pro Query-Head. Standard von GPT-2 bis zu den meisten dichten Modellen vor 2023.

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

Multi-Query-Attention (MQA) · 3

Ein einzelner geteilter KV-Head bedient alle Query-Köpfe — aggressive KV-Cache-Ersparnis bei Qualitätskosten; in Spitzen-Open-Modellen selten.

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1

Multi-Head-Latent-Attention (MLA) · 21

Keys und Values werden in einen latenten Vektor niedrigen Rangs komprimiert und verkleinern den KV-Cache drastisch; eingeführt mit DeepSeek-V2.

DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview

Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

hybride lineare Attention · 0

Eine Minderheit voller Attention-Schichten, durchsetzt mit linearen Attention-Schichten — nahezu konstanter Speicher trotz langem Kontext.

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full lineare Attention-Schichten, durchsetzt mit wenigen vollen Attention-Schichten

Operator-Adoption

Jede Zeile ist eine Technik; das Jahr ist der früheste Open-Weight-Einsatz im Korpus.

Attention / ThemaModellErster Open-Weight-Adopter
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)