Scomposizione per operatori

Questa pagina smonta il corpus operatore per operatore: cosa fa ciascuno, quanti modelli lo usano, chi l’ha rilasciato per primo in pesi aperti e dove sta la prova — il campo esatto del config.json, più l’articolo originale se esiste.

Operatori di attention

OperatoreMeccanismo e significatoModelloPrimo adottante a pesi apertiProva
MHA Ogni testa di query possiede la propria coppia chiave/valore: massima espressività, cache KV massima. 10 GPT-2 (2019-02) num_attention_heads = num_key_value_heads · arXiv:1706.03762
GQA Le teste di query condividono le teste KV in piccoli gruppi — quasi tutta la qualità MHA a una frazione della cache. 46 Llama 2 70B (2023-07) num_key_value_heads < num_attention_heads · arXiv:2305.13245
MQA Tutte le teste di query condividono un’unica testa KV: cache minima, qualche costo in qualità. 3 DeepSeek-V4-Flash (2026-04) num_key_value_heads = 1 · arXiv:1911.02150
MLA Chiavi e valori sono proiettati in un latente a basso rango più una piccola chiave RoPE disaccoppiata; la cache si riduce di un ordine di grandezza. 21 DeepSeek-V2 (2024-05) kv_lora_rank · arXiv:2405.04434
SWA Ogni token guarda solo una finestra scorrevole di token recenti; cache e costo crescono linearmente col contesto. 12 Mistral 7B (2023-09) sliding_window · arXiv:2310.06825
Linear attention (hybrid) Strati di attention lineare ricorrente a memoria quasi costante, alternati a una minoranza di strati completi. 0 linear_attn_config / layer types

Feed-forward e MoE

OperatoreMeccanismo e significatoModelloPrimo adottante a pesi apertiProva
MoE Il FFN diventa una rete di molti esperti; un router attiva il top-k per token, disaccoppiando capacità e calcolo. 55 DeepSeekMoE 16B (2024-01) n_routed_experts · num_experts_per_tok · arXiv:2401.06066
SwiGLU / SiLU Unità lineari gate con SiLU — qualità per parametro superiore ai blocchi GELU/ReLU semplici. 70 LLaMA 1 7B (2023-02) hidden_act = silu · arXiv:2002.05202

Normalizzazione e posizione

OperatoreMeccanismo e significatoModelloPrimo adottante a pesi apertiProva
RMSNorm Normalizza solo con la radice della media dei quadrati, senza centraggio: più economico e stabile su larga scala. 73 LLaMA 1 7B (2023-02) rms_norm_eps · arXiv:1910.07467
RoPE Codifica la posizione relativa ruotando le coppie Q/K; estrapola naturalmente col contesto. 58 Mistral 7B (2023-09) rope_theta · arXiv:2104.09864
YaRN long-context Riscal il spettro di frequenze di RoPE per allungare la finestra di contesto ben oltre il pre-addestramento. 0 rope_scaling.rope_type = yarn · arXiv:2309.00071

Inferenza e precisione

OperatoreMeccanismo e significatoModelloPrimo adottante a pesi apertiProva
Multi-Token Prediction Teste extra leggere predicono più token futuri per passaggio e accelerano il decodice. 39 DeepSeek-V3 (2024-12) num_nextn_predict_layers · arXiv:2412.19437
FP8 training Pesi e attivazioni in float a 8 bit: circa metà memoria e matmul più veloci alla scala di frontiera. 18 DeepSeek-V3 (2024-12) torch_dtype / quantization_config

Nota metodologica

L’adozione è decisa meccanicamente dal config.json distribuito (la colonna prove nomina i campi esatti). «Primo adottante» è la versione a pesi aperti più antica del corpus; i precedenti non aperti sono sulla pagina Articoli.