Operator-Zerlegung
Diese Seite nimmt den Korpus Operator für Operator auseinander: was jeder tut, wie viele Modelle ihn nutzen, wer ihn zuerst in offenen Gewichten auslieferte und wo der Beleg liegt — das exakte config.json-Feld, plus das Originalpaper, wenn vorhanden.
Attention-Operatoren
| Operator | Mechanismus & Bedeutung | Modell | Erster Open-Weight-Adopter | Beleg |
|---|---|---|---|---|
| MHA | Jeder Query-Head besitzt ein eigenes Key/Value-Head-Paar: volle Ausdruckskraft, größter KV-Cache. | 10 | GPT-2 (2019-02) | num_attention_heads = num_key_value_heads · arXiv:1706.03762 |
| GQA | Query-Heads teilen sich KV-Heads in kleinen Gruppen — fast die ganze MHA-Qualität zu einem Bruchteil des Caches. | 46 | Llama 2 70B (2023-07) | num_key_value_heads < num_attention_heads · arXiv:2305.13245 |
| MQA | Alle Query-Heads teilen einen einzigen KV-Head: minimaler Cache, leichte Qualitätseinbußen. | 3 | DeepSeek-V4-Flash (2026-04) | num_key_value_heads = 1 · arXiv:1911.02150 |
| MLA | Keys/Values werden in einen latenten Vektor niedrigen Rangs plus einen kleinen entkoppelten RoPE-Key projiziert; der Cache schrumpft um Größenordnungen. | 21 | DeepSeek-V2 (2024-05) | kv_lora_rank · arXiv:2405.04434 |
| SWA | Jedes Token beachtet nur ein gleitendes Fenster aktueller Tokens; Cache und Kosten wachsen linear mit dem Kontext. | 12 | Mistral 7B (2023-09) | sliding_window · arXiv:2310.06825 |
| Linear attention (hybrid) | Rekurrente lineare Attention-Schichten mit fast konstantem Speicher, durchsetzt mit wenigen vollen Attention-Schichten. | 0 | — | linear_attn_config / layer types |
Feed-Forward & MoE
| Operator | Mechanismus & Bedeutung | Modell | Erster Open-Weight-Adopter | Beleg |
|---|---|---|---|---|
| MoE | Das FFN wird zu vielen Expertennetzwerken; ein Router aktiviert pro Token das Top-k und entkoppelt Kapazität von Rechenleistung. | 55 | DeepSeekMoE 16B (2024-01) | n_routed_experts · num_experts_per_tok · arXiv:2401.06066 |
| SwiGLU / SiLU | Gelinierte lineare Einheiten mit SiLU — bessere Qualität pro Parameter als einfache GELU/ReLU-Blöcke. | 70 | LLaMA 1 7B (2023-02) | hidden_act = silu · arXiv:2002.05202 |
Normierung & Position
| Operator | Mechanismus & Bedeutung | Modell | Erster Open-Weight-Adopter | Beleg |
|---|---|---|---|---|
| RMSNorm | Normalisiert nur über die Quadratmittel, ohne Mittelwertzentrierung: günstiger und stabil bei großen Skalen. | 73 | LLaMA 1 7B (2023-02) | rms_norm_eps · arXiv:1910.07467 |
| RoPE | Codiert relative Position durch Rotation der Q/K-Paare; extrapoliert natürlich mit dem Kontext. | 58 | Mistral 7B (2023-09) | rope_theta · arXiv:2104.09864 |
| YaRN long-context | Skaliert das RoPE-Frequenzspektrum um, um das Kontextfenster weit über die Prätrainingslänge zu strecken. | 0 | — | rope_scaling.rope_type = yarn · arXiv:2309.00071 |
Inferenz & Präzision
| Operator | Mechanismus & Bedeutung | Modell | Erster Open-Weight-Adopter | Beleg |
|---|---|---|---|---|
| Multi-Token Prediction | Zusätzliche leichte Köpfe sagen mehrere zukünftige Tokens pro Durchlauf voraus und beschleunigen die Dekodierung. | 39 | DeepSeek-V3 (2024-12) | num_nextn_predict_layers · arXiv:2412.19437 |
| FP8 training | Gewichte und Aktivierungen in 8-Bit-Float: rund halber Speicher und schnellere Matmuls an der Frontierskala. | 18 | DeepSeek-V3 (2024-12) | torch_dtype / quantization_config |
Methodennotiz
Die Adaption wird mechanisch aus der mitgelieferten config.json bestimmt (die Belegspalte nennt die exakten Felder). „Erster Adopter" ist die früheste Open-Weight-Version im Korpus; frühere nicht-öffentliche Vorläufer auf der Paper-Seite.