オープンウェイト大規模言語モデルの構造解剖 · GPT-2 → 2026

オープンウェイトLLMの構造解剖

本アトラスは、GPT-2(2019年)から2026年までに公開された80のオープンウェイト大規模言語モデルのアーキテクチャを解剖します。ベンチマークスコアではなく構造を記録するのが方針です。注意機構がマルチヘッド(MHA)からグループ化クエリ(GQA)、マルチヘッド潜在(MLA)、ハイブリッド線形設計へとどう進化したか。スパースなMixture-of-ExpertsがデンスなFFN層にどう取って代わったか。どの研究機関がいつどのオペレータを採用したか。すべての数値はモデルに同梱された公開config.jsonか原論文に溯源できます。

80モデル
10開発元
55スパースMoE
2019–2026公開日

同じコーパスへの9つの入り口——疑問に合わせて視点を選べます。

モデル索引 80のオープンウェイトLLMアーキテクチャのソート可能な索引:総パラメータ、活性パラメータ、コンテキスト長、注意機構の変種、MoE構成、層数とヘッド数。 アーキテクチャの進化 LLMの注意機構がMHAからMQA、GQA、MLA、ハイブリッド線形設計へと進化した経緯と、各オペレータの採用タイムラインと最初のオープンウェイト採用モデル。 演算子分解 コーパスの各アーキテクチャ演算子——注意機構、MoE、正規化、位置エンコーディング、推論側——について、仕組み・採用数・最初のオープンウェイト採用モデル・証拠を示します。 タイムライン 2019年から2026年までの80のオープンウェイトLLM公開を時系列で可視化:横軸は公開日、縦軸は総パラメータ(対数スケール)、開発元で色分け。 系譜 開発元ごとに整理したモデル系譜:OpenAI、Meta、Mistral、DeepSeek、Qwen、GLM、Kimi、MiniMax、StepFun、騰訊混元(Hunyuan)。 構造類似度 アーキテクチャ特徴ベクトル間のコサイン類似度:注意機構クラス、MoE構成、正規化、位置エンコーディング、規模とコンテキスト。 論文 アトラスの全技術に対応する一次文献:Transformer、GQA、MLA、RoPE、YaRN、RMSNorm、SwiGLU、Mixtral、DeepSeek-V2/V3 ほか。 マルチモーダル 公開 config.json に含まれる視覚フィールドを根拠に、コーパスから画像対応モデルを機械的に抽出した一覧。 比較 最大4つのLLMアーキテクチャを並べて比較:注意機構、MoE構成、層数、コンテキスト、学習精度ほか。 全体マップ 80モデルを1枚の地図に:公開日と総パラメータ(対数スケール)、開発元で色分け。 モデルウォール アトラスの全モデルをカードで一枚に:開発元、公開日、パラメータ数、注意機構クラス、MoE構成をひと目で。 Configビューア 80のオープンウェイトモデルの公開config.jsonを全文閲覧:全フィールドを検索・コピー可能。 アーキテクチャクイズ LLMアーキテクチャの知識を試そう:注意機構の変種、MoE構成、開発元と規模——問題はアトラスのコーパスから自動生成。

総パラメータ · 活性パラメータ

1000B Kimi K3 Qwen3.8 2.4T A95B DeepSeek-V4-Pro Kimi K2 Base Kimi K2 0905 Kimi K2.5 Kimi K2.6 Hunyuan 4 Preview GLM-5.2 GLM-5.3 GLM-5 GLM-5.1 DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 DeepSeek-V3.1 DeepSeek-V3.2 MiniMax-Text-01 総パラメータ 活性パラメータ
最大級のオープンウェイトモデル:灰色のバーは総パラメータ(対数スケール)、赤いバーはトークンごとに活性化する割合。 · log₁₀