Die strukturelle Anatomie offener Sprachmodelle · GPT-2 → 2026
Die strukturelle Anatomie offener LLMs
Dieser Atlas sezriert die Architekturen von 80 offenen großen Sprachmodellen, die zwischen GPT-2 (2019) und 2026 veröffentlicht wurden. Er hält nicht Benchmark-Scores fest, sondern Struktur: wie sich Attention von Multi-Head zu Grouped-Query, Multi-Head-Latent und hybriden linearen Entwürfen entwickelte; wie sparse Mixture-of-Experts die dichten Feed-Forward-Blöcke ersetzte; und welche Operatoren welches Labor wann übernahm. Jede Zahl lässt sich bis zur öffentlichen config.json des Modells oder bis zur Originalpublikation zurückverfolgen.
80Modelle im Korpus
10Labor
55Sparsames MoE
2019–2026Veröffentlicht
Neun Zugänge zum selben Korpus — wählen Sie die Sicht, die Ihre Frage beantwortet.
Modellindex
Ein sortierbarer Index von 80 offenen LLM-Architekturen: Parameter, aktive Parameter, Kontextfenster, Attention-Variante, MoE-Layout, Schichten und Köpfe.
Evolution
Wie sich LLM-Attention von MHA zu MQA, GQA, MLA und hybriden linearen Entwürfen entwickelte — mit Adoptionszeitleiste jedes Operators und den ersten Adoptern.
Operatoren
Jeder Architekturoperator des Korpus — Attention, MoE, Normierung, Position und Inferenzseite — mit Mechanismus, Anzahl der Adaptionen, erstem Open-Weight-Adopter und Belegen.
Zeitstrahl
Eine chronologische Karte von 80 Open-Weight-LLM-Veröffentlichungen von 2019 bis 2026, aufgetragen nach Gesamtparametern und nach Labor gefärbt.
Linien
Modellfamilien gruppiert nach Labor: OpenAI, Meta, Mistral, DeepSeek, Qwen, GLM, Kimi, MiniMax, StepFun und Hunyuan.
Ähnlichkeit
Kosinusähnlichkeit zwischen Architektur-Merkmalvektoren: Attention-Klasse, MoE-Layout, Normierung, Positionscodierung, Skalierung und Kontext.
Papers
Die Originalpublikationen hinter jeder Technik des Atlas: Transformer, GQA, MLA, RoPE, YaRN, RMSNorm, SwiGLU, Mixtral, DeepSeek-V2/V3 und mehr.
Multimodal
Die visionfähigen Modelle des Korpus, objektiv identifiziert über die Vision-Felder in ihrer öffentlichen config.json.
Vergleich
Vergleichen Sie bis zu vier LLM-Architekturen nebeneinander: Attention, MoE-Layout, Schichten, Kontext, Präzision und mehr.
Karte
Alle 80 Modelle auf einer Karte: Veröffentlichungsdatum gegen Gesamtparameter (log-Skala), nach Labor gefärbt.
Modellwand
Jedes Modell des Atlas als Karte: Labor, Datum, Parameter, Attention-Klasse und MoE-Layout auf einen Blick.
Config-Ansicht
Durchsuchen Sie die vollständige öffentliche config.json aller 80 Modelle: jedes Feld, durchsuchbar und kopierbar.
Quiz
Testen Sie Ihr Wissen über LLM-Architekturen: Attention-Varianten, MoE-Layouts, Labore und Skalierung — Fragen aus dem Atlas-Korpus generiert.