Evoluzione architetturale

Le tecniche architetturali non emergono a caso: si diffondono da un laboratorio all'altro. Questa pagina traccia due curve: l'evoluzione dell'attention stessa e la cronologia di adozione degli operatori che rendono gli LLM moderni addestrabili ed economici da servire.

Attention: da MHA al lineare ibrido

Il multi-head attention (MHA) calcola una coppia di teste chiave–valore per ogni testa di query. Il multi-query (MQA) condivide un'unica testa KV tra tutte le query; il grouped-query (GQA) lo generalizza a poche teste condivise ed è diventato lo standard per i modelli densi dopo Llama 2 70B. Il multi-head latent attention (MLA), introdotto con DeepSeek-V2, comprime chiavi e valori in un vettore latente a basso rango. I disegni ibridi più recenti alternano strati di attention lineare a una minoranza di strati di attention completa.

attention multi-head (MHA) · 10

La formulazione originale: una coppia di teste chiave–valore per ogni testa di query. Standard da GPT-2 alla maggior parte dei modelli densi precedenti al 2023.

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

attention multi-query (MQA) · 3

Una singola testa KV condivisa serve tutte le teste di query — risparmi aggressivi di cache KV a costo di una certa qualità; rara nei modelli aperti di punta.

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1

attention multi-head latente (MLA) · 21

Chiavi e valori sono compressi in un vettore latente a basso rango, riducendo drasticamente la cache KV; introdotto con DeepSeek-V2.

DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview

Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

attention lineare ibrida · 0

Una minoranza di strati di attention completa alternata a strati di attention lineare, scambiando il costo del lungo contesto per una memoria quasi costante.

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full strati di attention lineare alternati a pochi strati di attention completa

Adozione degli operatori

Ogni riga è una tecnica; l'anno indicato è la prima pubblicazione a pesi aperti nel corpus.

Attention / ArgomentoModelloPrimo adottante a pesi aperti
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)