Français
← Retour à l’accueil

Architecture des modèles

Structures déterminant comment les modèles représentent et transforment l’information.

3 entrées

Frameworks et représentation

Logiciels et interfaces de données servant à construire, entraîner et exécuter les modèles.

3 entrées

Entraînement et post-entraînement

Méthodes de mise à l’échelle, d’adaptation et de préférence qui façonnent capacités et comportement.

4 entrées
2012–present

Distributed Training

Des techniques qui répartissent données, paramètres, activations ou calculs entre appareils et nœuds. Elles permettent l’entraînement de grands modèles, avec des compromis de communication, synchronisation et tolérance aux pannes.

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
2017 / 2022 / 2023

SFT / RLHF / DPO

Une famille de méthodes de post-entraînement visant le suivi d’instructions et l’alignement sur des préférences. Le SFT apprend de démonstrations, tandis que RLHF et DPO exploitent des comparaisons par des optimisations différentes.

  • supervised fine-tuning
  • preference data
  • reward model
2024 / 2025

Reasoning and test-time compute

Un post-entraînement qui apprend au modèle à produire une longue trace de raisonnement avant de répondre, et à dépenser davantage de calcul à l’inférence quand le problème est plus difficile. L’apprentissage par renforcement à récompenses vérifiables — où une réponse contrôlable fournit le signal d’entraînement — est ce qui a rendu l’approche reproductible hors des laboratoires fermés. Le compromis mérite d’être dit clairement : une précision obtenue par la longueur de génération plutôt que par un modèle plus grand, payée en latence et en coût de service.

  • reasoning traces
  • verifiable rewards
  • inference budget
2021 / 2023

LoRA / QLoRA

Des méthodes de réglage fin efficaces en paramètres qui entraînent de petits adaptateurs de faible rang en gelant le modèle de base. QLoRA ajoute une base quantifiée pour réduire encore la mémoire.

  • low-rank adapters
  • frozen base model
  • 4-bit training

Inférence et déploiement

Techniques de mémoire, planification, compression et exécution utilisées pour servir les modèles.

5 entrées

APPLICATION LAYER

Architecture applicative

Les modèles deviennent des produits grâce aux workflows, outils, échanges de contexte, garde-fous et évaluations. Les rubriques MCP et Outils couvrent cette couche sans la dupliquer ici.

Cas de modèles ouverts

Familles examinées selon le code, les poids, la divulgation de l’entraînement et la licence.

9 entrées
2023

Llama

La famille de Meta à poids téléchargeables a étendu l’inférence locale et le réglage fin. Ses conditions propres à Llama rendent « poids ouverts » plus précis qu’une qualification automatique d’open source au sens de l’OSI.

  • open weights
  • community license
  • model family
2023

Qwen

La famille Qwen d’Alibaba couvre modèles denses, experts routés, multilingues et multimodaux. De nombreux checkpoints sont téléchargeables, mais licence et divulgation doivent être vérifiées modèle par modèle.

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

La famille de Mistral AI comprend des modèles denses Mistral et des modèles Mixtral à experts routés. Certaines versions ont une licence permissive, d’autres non ; l’ouverture s’évalue donc artefact par artefact.

  • dense models
  • MoE
  • open weights
2023

DeepSeek

Les versions téléchargeables de DeepSeek ont stimulé l’étude du MoE, du post-entraînement de raisonnement et du service efficace. Code et poids peuvent avoir des licences différentes, tandis que les données constituent un axe distinct.

  • MoE
  • reasoning
  • open weights
2024

Gemma

La famille de Google à poids téléchargeables relie la recherche issue de Gemini au déploiement local, en périphérie ou hébergé. Google parle de modèles ouverts, mais l’usage reste régi par des conditions Gemma.

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2 publie la famille OLMo avec ses données de pré-entraînement, son code d’entraînement, ses points de contrôle intermédiaires et ses journaux, en plus des poids. Le premier OLMo est paru en février 2024, OLMo 2 en novembre de la même année, et Olmo 3 en novembre 2025, avec des variantes Base, Instruct et Think en 7B et 32B sous licence Apache 2.0. C’est le cas où les quatre éléments à vérifier séparément — code, poids, informations d’entraînement et licence — sont tous réellement publiés, ce qui en fait un point de repère face aux familles qui ne diffusent que les poids.

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

Les gpt-oss-120b et 20b d’OpenAI sont des modèles de raisonnement MoE téléchargeables pour l’inférence locale ou hébergée. Leurs poids et implémentations de référence sous Apache 2.0 élargissent le déploiement, sans publier le jeu de préentraînement lui-même.

  • open weights
  • reasoning
  • MoE
2026

GLM-5

La série GLM-5 de Z.ai est une grande famille de modèles de langage MoE pour le raisonnement, la programmation et le travail agentique de longue haleine. GLM-5 est paru en février 2026, 5.1 en avril, 5.2 en juin avec 753 milliards de paramètres et une fenêtre de contexte d’un million de jetons, et 5.3 en août sur la même base avec des modifications post-entraînement ; le plus petit GLM-5.3-Flash a suivi quelques jours plus tard avec 320 milliards de paramètres au total et 18 milliards actifs. L’échelle des plus grands membres rend l’auto-hébergement coûteux en ressources.

  • open weights
  • MoE
  • long context
2026

Kimi K3

Moonshot AI a publié Kimi K3 en juillet 2026 : un modèle de langage MoE multimodal natif à poids ouverts, doté de 2,8 billions de paramètres au total, 104 milliards actifs et d’un contexte d’un million de jetons. Il vise le code de longue durée, le travail intellectuel et les agents outillés, mais son déploiement local est exigeant.

  • open weights
  • MoE
  • long context

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.