L'anatomia strutturale dei modelli linguistici a pesi aperti · GPT-2 → 2026
L'anatomia strutturale degli LLM a pesi aperti
Questo atlante analizza le architetture di 80 grandi modelli linguistici a pesi aperti pubblicati tra GPT-2 (2019) e il 2026. Invece dei punteggi di benchmark registra la struttura: come l'attention è evoluta da multi-head a grouped-query, multi-head latent e disegni lineari ibridi; come i mixture-of-experts sparsi hanno sostituito i blocchi feed-forward densi; e quali operatori ciascun laboratorio ha adottato, e quando. Ogni cifra è riconducibile al config.json pubblico del modello o alla sua pubblicazione originale.
80modelli nel corpus
10Laboratorio
55MoE sparsa
2019–2026Pubblicazione
Nove modi di affrontare lo stesso corpus — scegli la vista che risponde alla tua domanda.
Indice modelli
Un indice ordinabile di 80 architetture LLM a pesi aperti: parametri totali, parametri attivi, finestra di contesto, variante di attention, schema MoE, strati e teste.
Evoluzione
Come l'attention degli LLM è passata da MHA a MQA, GQA, MLA e ai disegni lineari ibridi — con la cronologia di adozione di ogni operatore e i primi adottanti.
Operatori
Ogni operatore architetturale del corpus — attention, MoE, normalizzazione, posizione e lato inferenza — con meccanismo, numero di adozioni, primo adottante a pesi aperti e prove.
Cronologia
Una mappa cronologica degli 80 rilasci di LLM a pesi aperti dal 2019 al 2026, tracciata per parametri totali e colorata per laboratorio.
Linee
Famiglie di modelli raggruppate per laboratorio: OpenAI, Meta, Mistral, DeepSeek, Qwen, GLM, Kimi, MiniMax, StepFun e Hunyuan.
Similarità
Similarità coseno tra vettori di caratteristiche architetturali: classe di attention, schema MoE, normalizzazione, codifica posizionale, scala e contesto.
Articoli
Le pubblicazioni originali dietro ogni tecnica dell'atlante: Transformer, GQA, MLA, RoPE, YaRN, RMSNorm, SwiGLU, Mixtral, DeepSeek-V2/V3 e altri.
Multimodale
I modelli con capacità visive del corpus, identificati oggettivamente dai campi vision presenti nel loro config.json pubblico.
Confronto
Confronta fino a quattro architetture LLM affiancate: attention, schema MoE, strati, contesto, precisione e altro.
Mappa
Tutti gli 80 modelli su una sola mappa: data di rilascio contro parametri totali (scala log), colorati per laboratorio.
Muro dei modelli
Ogni modello dell'atlante in una scheda: laboratorio, data, parametri, classe di attention e schema MoE a colpo d'occhio.
Visualizzatore config
Sfoglia il config.json pubblico completo di ciascuno degli 80 modelli: ogni campo, ricercabile e copiabile.
Quiz
Metti alla prova la tua conoscenza delle architetture LLM: varianti di attention, schemi MoE, laboratori e scale — domande generate dal corpus dell'atlante.