L'anatomie structurelle des grands modèles de langage à poids ouverts · GPT-2 → 2026
L'anatomie structurelle des LLM à poids ouverts
Cet atlas dissèque l'architecture de 80 grands modèles de langage à poids ouverts publiés entre GPT-2 (2019) et 2026. Plutôt que des scores de benchmarks, il consigne la structure : comment l'attention a évolué du multi-tête au groupé-query, à l'attention latente multi-tête et aux conceptions linéaires hybrides ; comment les mélanges d'experts épars ont remplacé les blocs feed-forward denses ; et quels opérateurs chaque laboratoire a adoptés, et quand. Chaque chiffre est traçable jusqu'au config.json public du modèle ou jusqu'à sa publication originale.
80modèles du corpus
10Laboratoire
55MoE épars
2019–2026Publication
Neuf façons d'aborder le même corpus — choisissez la vue qui répond à votre question.
Index des modèles
Un index triable de 80 architectures de LLM à poids ouverts : paramètres totaux, paramètres actifs, fenêtre de contexte, variante d'attention, agencement MoE, couches et têtes.
Évolution
Comment l'attention des LLM est passée de MHA à MQA, GQA, MLA et aux conceptions linéaires hybrides — avec la chronologie d'adoption de chaque opérateur et ses premiers adoptants.
Opérateurs
Chaque opérateur architectural du corpus — attention, MoE, normalisation, position et côté inférence — avec son mécanisme, le nombre d’adoptions, le premier adoptant en poids ouverts et les preuves.
Chronologie
Une carte chronologique des 80 publications de LLM à poids ouverts de 2019 à 2026, tracée par paramètres totaux et colorée par laboratoire.
Lignées
Familles de modèles groupées par laboratoire : OpenAI, Meta, Mistral, DeepSeek, Qwen, GLM, Kimi, MiniMax, StepFun et Hunyuan.
Similarité
Similarité cosinus entre vecteurs de caractéristiques d'architecture : classe d'attention, agencement MoE, normalisation, encodage positionnel, échelle et contexte.
Articles
Les publications originales derrière chaque technique de l'atlas : Transformer, GQA, MLA, RoPE, YaRN, RMSNorm, SwiGLU, Mixtral, DeepSeek-V2/V3 et plus.
Multimodal
Les modèles à capacité visuelle du corpus, identifiés objectivement par les champs vision présents dans leur config.json public.
Comparer
Comparez jusqu'à quatre architectures de LLM côte à côte : attention, agencement MoE, couches, contexte, précision et plus.
Carte
Les 80 modèles sur une seule carte : date de publication en fonction des paramètres totaux (échelle log), colorés par laboratoire.
Mur des modèles
Chaque modèle de l'atlas en une carte : laboratoire, date, paramètres, classe d'attention et agencement MoE d'un coup d'œil.
Explorateur de config
Parcourez le config.json public complet de chacun des 80 modèles : chaque champ, consultable et copiable.
Quiz
Testez vos connaissances sur les architectures de LLM : variantes d'attention, agencements MoE, laboratoires et échelles — questions générées à partir du corpus de l'atlas.