アーキテクチャの進化

アーキテクチャ技術は突然現れるのではなく、研究機関から研究機関へと拡散します。本ページでは二つの流れを追います。すなわち注意機構そのものの進化と、現代のLLMを学習可能かつ低コストで推論可能にしたオペレータの採用タイムラインです。

注意機構:MHAからハイブリッド線形へ

マルチヘッド注意(MHA)はクエリヘッドごとにkey–valueヘッドを1組計算します。マルチクエリ注意(MQA)は全クエリが単一のKVヘッドを共有し、グループ化クエリ注意(GQA)は少数の共有ヘッドに一般化したもので、Llama 2 70B以降はデンスモデルの標準となりました。マルチヘッド潜在注意(MLA)はDeepSeek-V2で導入され、keyとvalueを低ランクの潜在ベクトルに圧縮します。最新のハイブリッド設計は線形注意層を主体とし、全注意層は少数のみ残します。

マルチヘッド注意(MHA) · 10

最初の形式:クエリヘッドごとに1組の key–value ヘッド。GPT-2 から2023年以前の多くのデンスモデルまで標準でした。

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

マルチクエリ注意(MQA) · 3

全クエリヘッドが単一のKVヘッドを共有——品質を多少犠牲にしてKVキャッシュを大幅に節約。最先端のオープンモデルでは稀です。

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1

マルチヘッド潜在注意(MLA) · 21

key と value を低ランクの潜在ベクトルに圧縮し、KVキャッシュを劇的に縮小。DeepSeek-V2 で導入されました。

DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview

Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

ハイブリッド線形注意 · 0

少数の全注意層を線形注意層に挟み込む設計で、ほぼ一定のメモリで長コンテキストを実現します。

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full 少数の全注意層を線形注意層に挟み込んだ構成

オペレータの採用

各行が1つの技術を表し、年はコーパス内で最も早くオープンウェイト版に実装したモデルの公開時期です。

注意機構 / トピックモデル最初のオープンウェイト採用
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)