Operator-Zerlegung

Diese Seite nimmt den Korpus Operator für Operator auseinander: was jeder tut, wie viele Modelle ihn nutzen, wer ihn zuerst in offenen Gewichten auslieferte und wo der Beleg liegt — das exakte config.json-Feld, plus das Originalpaper, wenn vorhanden.

Attention-Operatoren

OperatorMechanismus & BedeutungModellErster Open-Weight-AdopterBeleg
MHA Jeder Query-Head besitzt ein eigenes Key/Value-Head-Paar: volle Ausdruckskraft, größter KV-Cache. 10 GPT-2 (2019-02) num_attention_heads = num_key_value_heads · arXiv:1706.03762
GQA Query-Heads teilen sich KV-Heads in kleinen Gruppen — fast die ganze MHA-Qualität zu einem Bruchteil des Caches. 46 Llama 2 70B (2023-07) num_key_value_heads < num_attention_heads · arXiv:2305.13245
MQA Alle Query-Heads teilen einen einzigen KV-Head: minimaler Cache, leichte Qualitätseinbußen. 3 DeepSeek-V4-Flash (2026-04) num_key_value_heads = 1 · arXiv:1911.02150
MLA Keys/Values werden in einen latenten Vektor niedrigen Rangs plus einen kleinen entkoppelten RoPE-Key projiziert; der Cache schrumpft um Größenordnungen. 21 DeepSeek-V2 (2024-05) kv_lora_rank · arXiv:2405.04434
SWA Jedes Token beachtet nur ein gleitendes Fenster aktueller Tokens; Cache und Kosten wachsen linear mit dem Kontext. 12 Mistral 7B (2023-09) sliding_window · arXiv:2310.06825
Linear attention (hybrid) Rekurrente lineare Attention-Schichten mit fast konstantem Speicher, durchsetzt mit wenigen vollen Attention-Schichten. 0 linear_attn_config / layer types

Feed-Forward & MoE

OperatorMechanismus & BedeutungModellErster Open-Weight-AdopterBeleg
MoE Das FFN wird zu vielen Experten­netzwerken; ein Router aktiviert pro Token das Top-k und entkoppelt Kapazität von Rechenleistung. 55 DeepSeekMoE 16B (2024-01) n_routed_experts · num_experts_per_tok · arXiv:2401.06066
SwiGLU / SiLU Gelinierte lineare Einheiten mit SiLU — bessere Qualität pro Parameter als einfache GELU/ReLU-Blöcke. 70 LLaMA 1 7B (2023-02) hidden_act = silu · arXiv:2002.05202

Normierung & Position

OperatorMechanismus & BedeutungModellErster Open-Weight-AdopterBeleg
RMSNorm Normalisiert nur über die Quadratmittel, ohne Mittelwertzentrierung: günstiger und stabil bei großen Skalen. 73 LLaMA 1 7B (2023-02) rms_norm_eps · arXiv:1910.07467
RoPE Codiert relative Position durch Rotation der Q/K-Paare; extrapoliert natürlich mit dem Kontext. 58 Mistral 7B (2023-09) rope_theta · arXiv:2104.09864
YaRN long-context Skaliert das RoPE-Frequenzspektrum um, um das Kontextfenster weit über die Prätrainingslänge zu strecken. 0 rope_scaling.rope_type = yarn · arXiv:2309.00071

Inferenz & Präzision

OperatorMechanismus & BedeutungModellErster Open-Weight-AdopterBeleg
Multi-Token Prediction Zusätzliche leichte Köpfe sagen mehrere zukünftige Tokens pro Durchlauf voraus und beschleunigen die Dekodierung. 39 DeepSeek-V3 (2024-12) num_nextn_predict_layers · arXiv:2412.19437
FP8 training Gewichte und Aktivierungen in 8-Bit-Float: rund halber Speicher und schnellere Matmuls an der Frontierskala. 18 DeepSeek-V3 (2024-12) torch_dtype / quantization_config

Methodennotiz

Die Adaption wird mechanisch aus der mitgelieferten config.json bestimmt (die Belegspalte nennt die exakten Felder). „Erster Adopter" ist die früheste Open-Weight-Version im Korpus; frühere nicht-öffentliche Vorläufer auf der Paper-Seite.