Scomposizione per operatori
Questa pagina smonta il corpus operatore per operatore: cosa fa ciascuno, quanti modelli lo usano, chi l’ha rilasciato per primo in pesi aperti e dove sta la prova — il campo esatto del config.json, più l’articolo originale se esiste.
Operatori di attention
| Operatore | Meccanismo e significato | Modello | Primo adottante a pesi aperti | Prova |
|---|---|---|---|---|
| MHA | Ogni testa di query possiede la propria coppia chiave/valore: massima espressività, cache KV massima. | 10 | GPT-2 (2019-02) | num_attention_heads = num_key_value_heads · arXiv:1706.03762 |
| GQA | Le teste di query condividono le teste KV in piccoli gruppi — quasi tutta la qualità MHA a una frazione della cache. | 46 | Llama 2 70B (2023-07) | num_key_value_heads < num_attention_heads · arXiv:2305.13245 |
| MQA | Tutte le teste di query condividono un’unica testa KV: cache minima, qualche costo in qualità. | 3 | DeepSeek-V4-Flash (2026-04) | num_key_value_heads = 1 · arXiv:1911.02150 |
| MLA | Chiavi e valori sono proiettati in un latente a basso rango più una piccola chiave RoPE disaccoppiata; la cache si riduce di un ordine di grandezza. | 21 | DeepSeek-V2 (2024-05) | kv_lora_rank · arXiv:2405.04434 |
| SWA | Ogni token guarda solo una finestra scorrevole di token recenti; cache e costo crescono linearmente col contesto. | 12 | Mistral 7B (2023-09) | sliding_window · arXiv:2310.06825 |
| Linear attention (hybrid) | Strati di attention lineare ricorrente a memoria quasi costante, alternati a una minoranza di strati completi. | 0 | — | linear_attn_config / layer types |
Feed-forward e MoE
| Operatore | Meccanismo e significato | Modello | Primo adottante a pesi aperti | Prova |
|---|---|---|---|---|
| MoE | Il FFN diventa una rete di molti esperti; un router attiva il top-k per token, disaccoppiando capacità e calcolo. | 55 | DeepSeekMoE 16B (2024-01) | n_routed_experts · num_experts_per_tok · arXiv:2401.06066 |
| SwiGLU / SiLU | Unità lineari gate con SiLU — qualità per parametro superiore ai blocchi GELU/ReLU semplici. | 70 | LLaMA 1 7B (2023-02) | hidden_act = silu · arXiv:2002.05202 |
Normalizzazione e posizione
| Operatore | Meccanismo e significato | Modello | Primo adottante a pesi aperti | Prova |
|---|---|---|---|---|
| RMSNorm | Normalizza solo con la radice della media dei quadrati, senza centraggio: più economico e stabile su larga scala. | 73 | LLaMA 1 7B (2023-02) | rms_norm_eps · arXiv:1910.07467 |
| RoPE | Codifica la posizione relativa ruotando le coppie Q/K; estrapola naturalmente col contesto. | 58 | Mistral 7B (2023-09) | rope_theta · arXiv:2104.09864 |
| YaRN long-context | Riscal il spettro di frequenze di RoPE per allungare la finestra di contesto ben oltre il pre-addestramento. | 0 | — | rope_scaling.rope_type = yarn · arXiv:2309.00071 |
Inferenza e precisione
| Operatore | Meccanismo e significato | Modello | Primo adottante a pesi aperti | Prova |
|---|---|---|---|---|
| Multi-Token Prediction | Teste extra leggere predicono più token futuri per passaggio e accelerano il decodice. | 39 | DeepSeek-V3 (2024-12) | num_nextn_predict_layers · arXiv:2412.19437 |
| FP8 training | Pesi e attivazioni in float a 8 bit: circa metà memoria e matmul più veloci alla scala di frontiera. | 18 | DeepSeek-V3 (2024-12) | torch_dtype / quantization_config |
Nota metodologica
L’adozione è decisa meccanicamente dal config.json distribuito (la colonna prove nomina i campi esatti). «Primo adottante» è la versione a pesi aperti più antica del corpus; i precedenti non aperti sono sulla pagina Articoli.