L'anatomia strutturale dei modelli linguistici a pesi aperti · GPT-2 → 2026

L'anatomia strutturale degli LLM a pesi aperti

Questo atlante analizza le architetture di 80 grandi modelli linguistici a pesi aperti pubblicati tra GPT-2 (2019) e il 2026. Invece dei punteggi di benchmark registra la struttura: come l'attention è evoluta da multi-head a grouped-query, multi-head latent e disegni lineari ibridi; come i mixture-of-experts sparsi hanno sostituito i blocchi feed-forward densi; e quali operatori ciascun laboratorio ha adottato, e quando. Ogni cifra è riconducibile al config.json pubblico del modello o alla sua pubblicazione originale.

80modelli nel corpus
10Laboratorio
55MoE sparsa
2019–2026Pubblicazione

Nove modi di affrontare lo stesso corpus — scegli la vista che risponde alla tua domanda.

Indice modelli Un indice ordinabile di 80 architetture LLM a pesi aperti: parametri totali, parametri attivi, finestra di contesto, variante di attention, schema MoE, strati e teste. Evoluzione Come l'attention degli LLM è passata da MHA a MQA, GQA, MLA e ai disegni lineari ibridi — con la cronologia di adozione di ogni operatore e i primi adottanti. Operatori Ogni operatore architetturale del corpus — attention, MoE, normalizzazione, posizione e lato inferenza — con meccanismo, numero di adozioni, primo adottante a pesi aperti e prove. Cronologia Una mappa cronologica degli 80 rilasci di LLM a pesi aperti dal 2019 al 2026, tracciata per parametri totali e colorata per laboratorio. Linee Famiglie di modelli raggruppate per laboratorio: OpenAI, Meta, Mistral, DeepSeek, Qwen, GLM, Kimi, MiniMax, StepFun e Hunyuan. Similarità Similarità coseno tra vettori di caratteristiche architetturali: classe di attention, schema MoE, normalizzazione, codifica posizionale, scala e contesto. Articoli Le pubblicazioni originali dietro ogni tecnica dell'atlante: Transformer, GQA, MLA, RoPE, YaRN, RMSNorm, SwiGLU, Mixtral, DeepSeek-V2/V3 e altri. Multimodale I modelli con capacità visive del corpus, identificati oggettivamente dai campi vision presenti nel loro config.json pubblico. Confronto Confronta fino a quattro architetture LLM affiancate: attention, schema MoE, strati, contesto, precisione e altro. Mappa Tutti gli 80 modelli su una sola mappa: data di rilascio contro parametri totali (scala log), colorati per laboratorio. Muro dei modelli Ogni modello dell'atlante in una scheda: laboratorio, data, parametri, classe di attention e schema MoE a colpo d'occhio. Visualizzatore config Sfoglia il config.json pubblico completo di ciascuno degli 80 modelli: ogni campo, ricercabile e copiabile. Quiz Metti alla prova la tua conoscenza delle architetture LLM: varianti di attention, schemi MoE, laboratori e scale — domande generate dal corpus dell'atlante.

Parametri · Attivi

1000B Kimi K3 Qwen3.8 2.4T A95B DeepSeek-V4-Pro Kimi K2 Base Kimi K2 0905 Kimi K2.5 Kimi K2.6 Hunyuan 4 Preview GLM-5.2 GLM-5.3 GLM-5 GLM-5.1 DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 DeepSeek-V3.1 DeepSeek-V3.2 MiniMax-Text-01 Parametri Attivi
I più grandi modelli aperti: barra grigia = parametri totali (scala log); barra rossa = quota attiva per token. · log₁₀