L'anatomie structurelle des grands modèles de langage à poids ouverts · GPT-2 → 2026

L'anatomie structurelle des LLM à poids ouverts

Cet atlas dissèque l'architecture de 80 grands modèles de langage à poids ouverts publiés entre GPT-2 (2019) et 2026. Plutôt que des scores de benchmarks, il consigne la structure : comment l'attention a évolué du multi-tête au groupé-query, à l'attention latente multi-tête et aux conceptions linéaires hybrides ; comment les mélanges d'experts épars ont remplacé les blocs feed-forward denses ; et quels opérateurs chaque laboratoire a adoptés, et quand. Chaque chiffre est traçable jusqu'au config.json public du modèle ou jusqu'à sa publication originale.

80modèles du corpus
10Laboratoire
55MoE épars
2019–2026Publication

Neuf façons d'aborder le même corpus — choisissez la vue qui répond à votre question.

Index des modèles Un index triable de 80 architectures de LLM à poids ouverts : paramètres totaux, paramètres actifs, fenêtre de contexte, variante d'attention, agencement MoE, couches et têtes. Évolution Comment l'attention des LLM est passée de MHA à MQA, GQA, MLA et aux conceptions linéaires hybrides — avec la chronologie d'adoption de chaque opérateur et ses premiers adoptants. Opérateurs Chaque opérateur architectural du corpus — attention, MoE, normalisation, position et côté inférence — avec son mécanisme, le nombre d’adoptions, le premier adoptant en poids ouverts et les preuves. Chronologie Une carte chronologique des 80 publications de LLM à poids ouverts de 2019 à 2026, tracée par paramètres totaux et colorée par laboratoire. Lignées Familles de modèles groupées par laboratoire : OpenAI, Meta, Mistral, DeepSeek, Qwen, GLM, Kimi, MiniMax, StepFun et Hunyuan. Similarité Similarité cosinus entre vecteurs de caractéristiques d'architecture : classe d'attention, agencement MoE, normalisation, encodage positionnel, échelle et contexte. Articles Les publications originales derrière chaque technique de l'atlas : Transformer, GQA, MLA, RoPE, YaRN, RMSNorm, SwiGLU, Mixtral, DeepSeek-V2/V3 et plus. Multimodal Les modèles à capacité visuelle du corpus, identifiés objectivement par les champs vision présents dans leur config.json public. Comparer Comparez jusqu'à quatre architectures de LLM côte à côte : attention, agencement MoE, couches, contexte, précision et plus. Carte Les 80 modèles sur une seule carte : date de publication en fonction des paramètres totaux (échelle log), colorés par laboratoire. Mur des modèles Chaque modèle de l'atlas en une carte : laboratoire, date, paramètres, classe d'attention et agencement MoE d'un coup d'œil. Explorateur de config Parcourez le config.json public complet de chacun des 80 modèles : chaque champ, consultable et copiable. Quiz Testez vos connaissances sur les architectures de LLM : variantes d'attention, agencements MoE, laboratoires et échelles — questions générées à partir du corpus de l'atlas.

Paramètres · Actifs

1000B Kimi K3 Qwen3.8 2.4T A95B DeepSeek-V4-Pro Kimi K2 Base Kimi K2 0905 Kimi K2.5 Kimi K2.6 Hunyuan 4 Preview GLM-5.2 GLM-5.3 GLM-5 GLM-5.1 DeepSeek-V3 DeepSeek-V3 Base DeepSeek-R1 DeepSeek-V3.1 DeepSeek-V3.2 MiniMax-Text-01 Paramètres Actifs
Plus grands modèles à poids ouverts : barre grise = paramètres totaux (échelle log) ; barre rouge = part active par token. · log₁₀