연산자 단위 해부
이 페이지는 코퍼스를 연산자 단위로 해부합니다. 각 연산자의 역할, 사용 모델 수, 오픈웨이트로 최초 채택한 모델, 그리고 근거 — 정확한 config.json 필드명과 존재하는 경우 원 논문 — 를 보여줍니다.
어텐션 연산자
| 연산자 | 메커니즘과 의미 | 모델 | 최초 오픈웨이트 채택 | 근거 |
|---|---|---|---|---|
| MHA | 쿼리 헤드마다 전용 key/value 헤드를 가집니다. 표현력은 최대, KV 캐시도 최대입니다. | 10 | GPT-2 (2019-02) | num_attention_heads = num_key_value_heads · arXiv:1706.03762 |
| GQA | 쿼리 헤드가 소그룹으로 KV 헤드를 공유합니다. MHA 품질 대부분을 유지하며 캐시를 크게 줄입니다. | 46 | Llama 2 70B (2023-07) | num_key_value_heads < num_attention_heads · arXiv:2305.13245 |
| MQA | 모든 쿼리 헤드가 단일 KV 헤드를 공유합니다. 캐시는 최소, 품질 손실은 약간입니다. | 3 | DeepSeek-V4-Flash (2026-04) | num_key_value_heads = 1 · arXiv:1911.02150 |
| MLA | key/value를 저랭크 잠재 벡터로 투영하고 작은 분리 RoPE 키를 더합니다. 캐시가 한 자릿수 줄어듭니다. | 21 | DeepSeek-V2 (2024-05) | kv_lora_rank · arXiv:2405.04434 |
| SWA | 각 토큰은 최근 슬라이딩 윈도우 안에서만 어텐션합니다. 캐시와 비용이 컨텍스트에 선형으로 증가합니다. | 12 | Mistral 7B (2023-09) | sliding_window · arXiv:2310.06825 |
| Linear attention (hybrid) | 거의 일정한 메모리의 순환형 선형 어텐션 층 사이에 소수의 전체 어텐션 층을 배치합니다. | 0 | — | linear_attn_config / layer types |
FFN과 MoE
| 연산자 | 메커니즘과 의미 | 모델 | 최초 오픈웨이트 채택 | 근거 |
|---|---|---|---|---|
| MoE | FFN을 다수의 전문가 네트워크로 바꾸고 라우터가 토큰마다 top-k를 활성화합니다. 용량과 계산량을 분리합니다. | 55 | DeepSeekMoE 16B (2024-01) | n_routed_experts · num_experts_per_tok · arXiv:2401.06066 |
| SwiGLU / SiLU | SiLU 게이트가 있는 GLU. 단순 GELU/ReLU FFN보다 파라미터당 품질이 높습니다. | 70 | LLaMA 1 7B (2023-02) | hidden_act = silu · arXiv:2002.05202 |
정규화와 위치
| 연산자 | 메커니즘과 의미 | 모델 | 최초 오픈웨이트 채택 | 근거 |
|---|---|---|---|---|
| RMSNorm | 평균 중심화 없이 제곱평균제곱근으로만 정규화합니다. 저렴하고 대규모에서도 안정적입니다. | 73 | LLaMA 1 7B (2023-02) | rms_norm_eps · arXiv:1910.07467 |
| RoPE | Q/K 쌍의 회전으로 상대 위치를 인코딩합니다. 컨텍스트와 함께 자연스럽게 외삽됩니다. | 58 | Mistral 7B (2023-09) | rope_theta · arXiv:2104.09864 |
| YaRN long-context | RoPE 주파수 스펙트럼을 재조정해 사전학습 길이를 훌쩍 넘는 컨텍스트를 처리합니다. | 0 | — | rope_scaling.rope_type = yarn · arXiv:2309.00071 |
추론과 정밀도
| 연산자 | 메커니즘과 의미 | 모델 | 최초 오픈웨이트 채택 | 근거 |
|---|---|---|---|---|
| Multi-Token Prediction | 가벼운 추가 헤드가 한 번의 순전파로 여러 미래 토큰을 예측해 디코딩을 가속합니다. | 39 | DeepSeek-V3 (2024-12) | num_nextn_predict_layers · arXiv:2412.19437 |
| FP8 training | 가중치와 활성값을 8비트 부동소수로. 메모리 약 절반, 대규모 행렬곱이 빨라집니다. | 18 | DeepSeek-V3 (2024-12) | torch_dtype / quantization_config |
기준 설명
채택 여부는 공개된 config.json으로 기계적으로 판정합니다(근거 열에 정확한 필드명 기재). "최초 채택"은 이 코퍼스에서 가장 이른 오픈웨이트 버전이며, 더 이른 비공개 선례는 논문 페이지를 참고하세요.