아키텍처 진화

아키텍처 기술은 우연히 나타나지 않습니다. 연구소에서 연구소로 확산됩니다. 이 페이지는 두 갈래 흐름을 추적합니다. 어텐션 자체의 진화와, 현대 LLM을 학습 가능하고 저비용 추론 가능하게 만든 연산자들의 채택 타임라인입니다.

어텐션: MHA에서 하이브리드 선형까지

멀티헤드 어텐션(MHA)은 쿼리 헤드마다 한 조의 key–value 헤드를 계산합니다. 멀티쿼리 어텐션(MQA)은 모든 쿼리가 단일 KV 헤드를 공유하고, 그룹화 쿼리 어텐션(GQA)은 이를 소수의 공유 헤드로 일반화하여 Llama 2 70B 이후 덴스 모델의 기본 선택이 되었습니다. 멀티헤드 잠재 어텐션(MLA)은 DeepSeek-V2에서 도입되었으며, key와 value를 저랭크 잠재 벡터로 압축합니다. 가장 최근의 하이브리드 설계는 선형 어텐션 층을 중심으로 하고 전체 어텐션 층은 소수만 유지합니다.

멀티헤드 어텐션(MHA) · 10

최초의 형태: 쿼리 헤드마다 한 조의 key–value 헤드. GPT-2부터 2023년 이전 대부분의 덴스 모델까지 표준이었습니다.

GPT-2 GPT-3 175B (paper) LLaMA 1 7B DeepSeek-Coder 6.7B DeepSeek LLM 7B DeepSeekMoE 16B Qwen1.5 7B Step-3 Step-3.5-Flash Step-3.7-Flash

Q K·V Q1 KV1 Q2 KV2 Q3 KV3 Q4 KV4 4 : 4

멀티쿼리 어텐션(MQA) · 3

모든 쿼리 헤드가 단일 KV 헤드를 공유 — 일정 품질 손실을 감수하고 KV 캐시를 크게 절약. 최상위 오픈 모델에서는 드뭅니다.

DeepSeek-V4-Flash DeepSeek-V4-Flash Base DeepSeek-V4-Pro

Q K·V Q1 Q2 Q3 Q4 KV 4 : 1

멀티헤드 잠재 어텐션(MLA) · 21

key와 value를 저랭크 잠재 벡터로 압축하여 KV 캐시를 획기적으로 줄입니다. DeepSeek-V2에서 도입되었습니다.

DeepSeek-V2 DeepSeek-V2 Lite DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 Moonlight 16B Kimi K2 Base DeepSeek-V3.1 DeepSeek-V3.2 Kimi K2 0905 Kimi Linear 48B A3B GLM-4.7-Flash GLM-5 Kimi K2.5 GLM-5.1 Kimi K2.6 GLM-5.2 Kimi K3 GLM-5.3 GLM-5.3-Flash Hunyuan 4 Preview

Q K·V Q1 Q2 Q3 Q4 c_KV low-rank KV KV KV kv_lora_rank ≪ d_model

하이브리드 선형 어텐션 · 0

소수의 전체 어텐션 층을 선형 어텐션 층 사이에 배치하여, 거의 일정한 메모리로 긴 컨텍스트를 처리합니다.

Q K·V L L L L F L L L L L L L F L L L L F L = linear F = full 소수의 전체 어텐션 층을 선형 어텐션 층 사이에 배치

연산자 채택

각 행은 하나의 기술이며, 연도는 코퍼스에서 가장 먼저 오픈웨이트 버전에 탑재한 모델의 공개 시점입니다.

어텐션 / 주제모델최초 오픈웨이트 채택
MHA 10 GPT-2 (2019-02)
GQA 46 Llama 2 70B (2023-07)
MLA 21 DeepSeek-V2 (2024-05)
MQA 3 DeepSeek-V4-Flash (2026-04)
SWA 12 Mistral 7B (2023-09)
Linear attention (hybrid) 0
MoE 55 DeepSeekMoE 16B (2024-01)
RoPE 58 Mistral 7B (2023-09)
YaRN long-context 0
RMSNorm 73 LLaMA 1 7B (2023-02)
SwiGLU / SiLU 70 LLaMA 1 7B (2023-02)
Multi-Token Prediction 39 DeepSeek-V3 (2024-12)
FP8 training 18 DeepSeek-V3 (2024-12)