Die strukturelle Anatomie offener Sprachmodelle · GPT-2 → 2026

Die strukturelle Anatomie offener LLMs

Dieser Atlas sezriert die Architekturen von 80 offenen großen Sprachmodellen, die zwischen GPT-2 (2019) und 2026 veröffentlicht wurden. Er hält nicht Benchmark-Scores fest, sondern Struktur: wie sich Attention von Multi-Head zu Grouped-Query, Multi-Head-Latent und hybriden linearen Entwürfen entwickelte; wie sparse Mixture-of-Experts die dichten Feed-Forward-Blöcke ersetzte; und welche Operatoren welches Labor wann übernahm. Jede Zahl lässt sich bis zur öffentlichen config.json des Modells oder bis zur Originalpublikation zurückverfolgen.

80Modelle im Korpus
10Labor
55Sparsames MoE
2019–2026Veröffentlicht

Neun Zugänge zum selben Korpus — wählen Sie die Sicht, die Ihre Frage beantwortet.

Modellindex Ein sortierbarer Index von 80 offenen LLM-Architekturen: Parameter, aktive Parameter, Kontextfenster, Attention-Variante, MoE-Layout, Schichten und Köpfe. Evolution Wie sich LLM-Attention von MHA zu MQA, GQA, MLA und hybriden linearen Entwürfen entwickelte — mit Adoptionszeitleiste jedes Operators und den ersten Adoptern. Operatoren Jeder Architekturoperator des Korpus — Attention, MoE, Normierung, Position und Inferenzseite — mit Mechanismus, Anzahl der Adaptionen, erstem Open-Weight-Adopter und Belegen. Zeitstrahl Eine chronologische Karte von 80 Open-Weight-LLM-Veröffentlichungen von 2019 bis 2026, aufgetragen nach Gesamtparametern und nach Labor gefärbt. Linien Modellfamilien gruppiert nach Labor: OpenAI, Meta, Mistral, DeepSeek, Qwen, GLM, Kimi, MiniMax, StepFun und Hunyuan. Ähnlichkeit Kosinusähnlichkeit zwischen Architektur-Merkmalvektoren: Attention-Klasse, MoE-Layout, Normierung, Positionscodierung, Skalierung und Kontext. Papers Die Originalpublikationen hinter jeder Technik des Atlas: Transformer, GQA, MLA, RoPE, YaRN, RMSNorm, SwiGLU, Mixtral, DeepSeek-V2/V3 und mehr. Multimodal Die visionfähigen Modelle des Korpus, objektiv identifiziert über die Vision-Felder in ihrer öffentlichen config.json. Vergleich Vergleichen Sie bis zu vier LLM-Architekturen nebeneinander: Attention, MoE-Layout, Schichten, Kontext, Präzision und mehr. Karte Alle 80 Modelle auf einer Karte: Veröffentlichungsdatum gegen Gesamtparameter (log-Skala), nach Labor gefärbt. Modellwand Jedes Modell des Atlas als Karte: Labor, Datum, Parameter, Attention-Klasse und MoE-Layout auf einen Blick. Config-Ansicht Durchsuchen Sie die vollständige öffentliche config.json aller 80 Modelle: jedes Feld, durchsuchbar und kopierbar. Quiz Testen Sie Ihr Wissen über LLM-Architekturen: Attention-Varianten, MoE-Layouts, Labore und Skalierung — Fragen aus dem Atlas-Korpus generiert.

Parameter · Aktiv

1000B Kimi K3 Qwen3.8 2.4T A95B DeepSeek-V4-Pro Kimi K2 Base Kimi K2 0905 Kimi K2.5 Kimi K2.6 Hunyuan 4 Preview GLM-5.2 GLM-5.3 GLM-5 GLM-5.1 DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 DeepSeek-V3.1 DeepSeek-V3.2 MiniMax-Text-01 Parameter Aktiv
Größte offene Modelle: grauer Balken = Gesamtparameter (log-Skala); roter Balken = aktivierter Anteil pro Token. · log₁₀