アーキテクチャの進化
アーキテクチャ技術は突然現れるのではなく、研究機関から研究機関へと拡散します。本ページでは二つの流れを追います。すなわち注意機構そのものの進化と、現代のLLMを学習可能かつ低コストで推論可能にしたオペレータの採用タイムラインです。
注意機構:MHAからハイブリッド線形へ
マルチヘッド注意(MHA)はクエリヘッドごとにkey–valueヘッドを1組計算します。マルチクエリ注意(MQA)は全クエリが単一のKVヘッドを共有し、グループ化クエリ注意(GQA)は少数の共有ヘッドに一般化したもので、Llama 2 70B以降はデンスモデルの標準となりました。マルチヘッド潜在注意(MLA)はDeepSeek-V2で導入され、keyとvalueを低ランクの潜在ベクトルに圧縮します。最新のハイブリッド設計は線形注意層を主体とし、全注意層は少数のみ残します。
マルチヘッド注意(MHA) · 10
最初の形式:クエリヘッドごとに1組の key–value ヘッド。GPT-2 から2023年以前の多くのデンスモデルまで標準でした。
GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash
マルチクエリ注意(MQA) · 3
全クエリヘッドが単一のKVヘッドを共有——品質を多少犠牲にしてKVキャッシュを大幅に節約。最先端のオープンモデルでは稀です。
グループ化クエリ注意(GQA) · 46
少数のKVヘッドをクエリヘッドのグループで共有。Llama 2 70B 以降、デンスなオープンモデルの標準です。
Llama 2 70B Mistral 7B ChatGLM3 6B Mixtral 8x22B GLM-4 9B Qwen2 72B Llama 3.1 70B Llama 3.1 8B Qwen2.5 72B Qwen2.5 7B MiniMax-Text-01 Qwen3 0.6B Qwen3 235B A22B Qwen3 30B A3B Qwen3 32B Qwen3 8B MiniMax-M1 GLM-4.5 GLM-4.5-Air Hunyuan 7B GPT-OSS 120B GPT-OSS 20B Qwen3-Next 80B A3B GLM-4.6 MiniMax-M2 Qwen3-Coder-Next MiniMax-M2.5 Qwen3.5 122B A10B Qwen3.5 27B Qwen3.5 35B A3B Qwen3.5 397B A17B Qwen3.5 9B Qwen3.5 9B Base Hunyuan 3 Preview Hunyuan 3 Preview Base MiniMax-M2.7 Qwen3.6 27B Qwen3.6 35B A3B Hunyuan-TurboS 30B A3B Hunyuan-TurboS 7B MiniMax-M3 MiniMax-M3 MXFP8 Hunyuan 3 Qwen3.8 2.4T A95B Qwen3.8 27B Qwen3.8-Flash-Next
マルチヘッド潜在注意(MLA) · 21
key と value を低ランクの潜在ベクトルに圧縮し、KVキャッシュを劇的に縮小。DeepSeek-V2 で導入されました。
DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview
ハイブリッド線形注意 · 0
少数の全注意層を線形注意層に挟み込む設計で、ほぼ一定のメモリで長コンテキストを実現します。
オペレータの採用
各行が1つの技術を表し、年はコーパス内で最も早くオープンウェイト版に実装したモデルの公開時期です。
| 注意機構 / トピック | モデル | 最初のオープンウェイト採用 |
|---|---|---|
| MHA | 10 | GPT-2 (2019-02) |
| GQA | 46 | Llama 2 70B (2023-07) |
| MLA | 21 | DeepSeek-V2 (2024-05) |
| MQA | 3 | DeepSeek-V4-Flash (2026-04) |
| SWA | 12 | Mistral 7B (2023-09) |
| Linear attention (hybrid) | 0 | — |
| MoE | 55 | DeepSeekMoE 16B (2024-01) |
| RoPE | 58 | Mistral 7B (2023-09) |
| YaRN long-context | 0 | — |
| RMSNorm | 73 | LLaMA 1 7B (2023-02) |
| SwiGLU / SiLU | 70 | LLaMA 1 7B (2023-02) |
| Multi-Token Prediction | 39 | DeepSeek-V3 (2024-12) |
| FP8 training | 18 | DeepSeek-V3 (2024-12) |