オープンウェイト大規模言語モデルの構造解剖 · GPT-2 → 2026
オープンウェイトLLMの構造解剖
本アトラスは、GPT-2(2019年)から2026年までに公開された80のオープンウェイト大規模言語モデルのアーキテクチャを解剖します。ベンチマークスコアではなく構造を記録するのが方針です。注意機構がマルチヘッド(MHA)からグループ化クエリ(GQA)、マルチヘッド潜在(MLA)、ハイブリッド線形設計へとどう進化したか。スパースなMixture-of-ExpertsがデンスなFFN層にどう取って代わったか。どの研究機関がいつどのオペレータを採用したか。すべての数値はモデルに同梱された公開config.jsonか原論文に溯源できます。
80モデル
10開発元
55スパースMoE
2019–2026公開日
同じコーパスへの9つの入り口——疑問に合わせて視点を選べます。
モデル索引
80のオープンウェイトLLMアーキテクチャのソート可能な索引:総パラメータ、活性パラメータ、コンテキスト長、注意機構の変種、MoE構成、層数とヘッド数。
アーキテクチャの進化
LLMの注意機構がMHAからMQA、GQA、MLA、ハイブリッド線形設計へと進化した経緯と、各オペレータの採用タイムラインと最初のオープンウェイト採用モデル。
演算子分解
コーパスの各アーキテクチャ演算子——注意機構、MoE、正規化、位置エンコーディング、推論側——について、仕組み・採用数・最初のオープンウェイト採用モデル・証拠を示します。
タイムライン
2019年から2026年までの80のオープンウェイトLLM公開を時系列で可視化:横軸は公開日、縦軸は総パラメータ(対数スケール)、開発元で色分け。
系譜
開発元ごとに整理したモデル系譜:OpenAI、Meta、Mistral、DeepSeek、Qwen、GLM、Kimi、MiniMax、StepFun、騰訊混元(Hunyuan)。
構造類似度
アーキテクチャ特徴ベクトル間のコサイン類似度:注意機構クラス、MoE構成、正規化、位置エンコーディング、規模とコンテキスト。
論文
アトラスの全技術に対応する一次文献:Transformer、GQA、MLA、RoPE、YaRN、RMSNorm、SwiGLU、Mixtral、DeepSeek-V2/V3 ほか。
マルチモーダル
公開 config.json に含まれる視覚フィールドを根拠に、コーパスから画像対応モデルを機械的に抽出した一覧。
比較
最大4つのLLMアーキテクチャを並べて比較:注意機構、MoE構成、層数、コンテキスト、学習精度ほか。
全体マップ
80モデルを1枚の地図に:公開日と総パラメータ(対数スケール)、開発元で色分け。
モデルウォール
アトラスの全モデルをカードで一枚に:開発元、公開日、パラメータ数、注意機構クラス、MoE構成をひと目で。
Configビューア
80のオープンウェイトモデルの公開config.jsonを全文閲覧:全フィールドを検索・コピー可能。
アーキテクチャクイズ
LLMアーキテクチャの知識を試そう:注意機構の変種、MoE構成、開発元と規模——問題はアトラスのコーパスから自動生成。