아키텍처 진화
아키텍처 기술은 우연히 나타나지 않습니다. 연구소에서 연구소로 확산됩니다. 이 페이지는 두 갈래 흐름을 추적합니다. 어텐션 자체의 진화와, 현대 LLM을 학습 가능하고 저비용 추론 가능하게 만든 연산자들의 채택 타임라인입니다.
어텐션: MHA에서 하이브리드 선형까지
멀티헤드 어텐션(MHA)은 쿼리 헤드마다 한 조의 key–value 헤드를 계산합니다. 멀티쿼리 어텐션(MQA)은 모든 쿼리가 단일 KV 헤드를 공유하고, 그룹화 쿼리 어텐션(GQA)은 이를 소수의 공유 헤드로 일반화하여 Llama 2 70B 이후 덴스 모델의 기본 선택이 되었습니다. 멀티헤드 잠재 어텐션(MLA)은 DeepSeek-V2에서 도입되었으며, key와 value를 저랭크 잠재 벡터로 압축합니다. 가장 최근의 하이브리드 설계는 선형 어텐션 층을 중심으로 하고 전체 어텐션 층은 소수만 유지합니다.
멀티헤드 어텐션(MHA) · 10
최초의 형태: 쿼리 헤드마다 한 조의 key–value 헤드. GPT-2부터 2023년 이전 대부분의 덴스 모델까지 표준이었습니다.
GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash
멀티쿼리 어텐션(MQA) · 3
모든 쿼리 헤드가 단일 KV 헤드를 공유 — 일정 품질 손실을 감수하고 KV 캐시를 크게 절약. 최상위 오픈 모델에서는 드뭅니다.
그룹화 쿼리 어텐션(GQA) · 46
소수의 KV 헤드를 쿼리 헤드 그룹이 공유. Llama 2 70B 이후 덴스 오픈 모델의 기본 선택입니다.
Llama 2 70B Mistral 7B ChatGLM3 6B Mixtral 8x22B GLM-4 9B Qwen2 72B Llama 3.1 70B Llama 3.1 8B Qwen2.5 72B Qwen2.5 7B MiniMax-Text-01 Qwen3 0.6B Qwen3 235B A22B Qwen3 30B A3B Qwen3 32B Qwen3 8B MiniMax-M1 GLM-4.5 GLM-4.5-Air Hunyuan 7B GPT-OSS 120B GPT-OSS 20B Qwen3-Next 80B A3B GLM-4.6 MiniMax-M2 Qwen3-Coder-Next MiniMax-M2.5 Qwen3.5 122B A10B Qwen3.5 27B Qwen3.5 35B A3B Qwen3.5 397B A17B Qwen3.5 9B Qwen3.5 9B Base Hunyuan 3 Preview Hunyuan 3 Preview Base MiniMax-M2.7 Qwen3.6 27B Qwen3.6 35B A3B Hunyuan-TurboS 30B A3B Hunyuan-TurboS 7B MiniMax-M3 MiniMax-M3 MXFP8 Hunyuan 3 Qwen3.8 2.4T A95B Qwen3.8 27B Qwen3.8-Flash-Next
멀티헤드 잠재 어텐션(MLA) · 21
key와 value를 저랭크 잠재 벡터로 압축하여 KV 캐시를 획기적으로 줄입니다. DeepSeek-V2에서 도입되었습니다.
DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview
하이브리드 선형 어텐션 · 0
소수의 전체 어텐션 층을 선형 어텐션 층 사이에 배치하여, 거의 일정한 메모리로 긴 컨텍스트를 처리합니다.
연산자 채택
각 행은 하나의 기술이며, 연도는 코퍼스에서 가장 먼저 오픈웨이트 버전에 탑재한 모델의 공개 시점입니다.
| 어텐션 / 주제 | 모델 | 최초 오픈웨이트 채택 |
|---|---|---|
| MHA | 10 | GPT-2 (2019-02) |
| GQA | 46 | Llama 2 70B (2023-07) |
| MLA | 21 | DeepSeek-V2 (2024-05) |
| MQA | 3 | DeepSeek-V4-Flash (2026-04) |
| SWA | 12 | Mistral 7B (2023-09) |
| Linear attention (hybrid) | 0 | — |
| MoE | 55 | DeepSeekMoE 16B (2024-01) |
| RoPE | 58 | Mistral 7B (2023-09) |
| YaRN long-context | 0 | — |
| RMSNorm | 73 | LLaMA 1 7B (2023-02) |
| SwiGLU / SiLU | 70 | LLaMA 1 7B (2023-02) |
| Multi-Token Prediction | 39 | DeepSeek-V3 (2024-12) |
| FP8 training | 18 | DeepSeek-V3 (2024-12) |