TECHNOLOGY GRAPH
Technologies de l’IA
Des architectures et de l’entraînement à l’inférence, au déploiement et aux modèles à poids ouverts
Une carte éditoriale des couches qui transforment les idées de recherche en modèles entraînables et en systèmes utilisables. Chaque entrée relie articles, histoire, modèles, outils et sources primaires.
Architecture des modèles
Structures déterminant comment les modèles représentent et transforment l’information.
Transformer
Une architecture neuronale fondée sur l’attention qui traite en parallèle les positions d’une séquence. Elle sous-tend de nombreux modèles de langage et multimodaux modernes.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
Une famille d’architectures à experts routés. Les variantes clairsemées modernes n’activent que certains experts par entrée, ce qui accroît la capacité sans mobiliser tous les paramètres pour chaque jeton.
- experts
- router
- sparse activation
Diffusion Model
Un modèle génératif qui apprend à inverser un processus d’ajout progressif de bruit. Le débruitage itératif est devenu majeur pour la génération d’images, d’audio, de vidéo et de contenus multimodaux.
- forward noise
- denoising
- score matching
Frameworks et représentation
Logiciels et interfaces de données servant à construire, entraîner et exécuter les modèles.
PyTorch
Un framework open source de tenseurs et d’apprentissage profond avec différenciation automatique, modules neuronaux, compilation et exécution distribuée. Il sert de la recherche à l’entraînement en production.
- tensor
- autograd
- module
Hugging Face Transformers
Une bibliothèque de définition de modèles reliant les architectures préentraînées aux écosystèmes d’entraînement et d’inférence. Elle normalise configuration, prétraitement, chargement, génération et interfaces de tâches.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
La conversion du texte brut en unités discrètes traitées par un modèle. La construction du vocabulaire et la segmentation influencent longueur de séquence, couverture multilingue, coût et comportement.
- token
- vocabulary
- BPE
Entraînement et post-entraînement
Méthodes de mise à l’échelle, d’adaptation et de préférence qui façonnent capacités et comportement.
Distributed Training
Des techniques qui répartissent données, paramètres, activations ou calculs entre appareils et nœuds. Elles permettent l’entraînement de grands modèles, avec des compromis de communication, synchronisation et tolérance aux pannes.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
Une famille de méthodes de post-entraînement visant le suivi d’instructions et l’alignement sur des préférences. Le SFT apprend de démonstrations, tandis que RLHF et DPO exploitent des comparaisons par des optimisations différentes.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
Un post-entraînement qui apprend au modèle à produire une longue trace de raisonnement avant de répondre, et à dépenser davantage de calcul à l’inférence quand le problème est plus difficile. L’apprentissage par renforcement à récompenses vérifiables — où une réponse contrôlable fournit le signal d’entraînement — est ce qui a rendu l’approche reproductible hors des laboratoires fermés. Le compromis mérite d’être dit clairement : une précision obtenue par la longueur de génération plutôt que par un modèle plus grand, payée en latence et en coût de service.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
Des méthodes de réglage fin efficaces en paramètres qui entraînent de petits adaptateurs de faible rang en gelant le modèle de base. QLoRA ajoute une base quantifiée pour réduire encore la mémoire.
- low-rank adapters
- frozen base model
- 4-bit training
Inférence et déploiement
Techniques de mémoire, planification, compression et exécution utilisées pour servir les modèles.
Quantization
La représentation des poids, activations ou caches avec une précision numérique réduite. Elle diminue mémoire, bande passante et calcul, au prix de compromis de précision et de matériel.
- precision
- INT8
- INT4
KV Cache
Un cache des clés et valeurs d’attention des jetons précédents pendant la génération autorégressive. Il évite de recalculer tout le préfixe, mais consomme souvent beaucoup de mémoire.
- keys
- values
- prefill
Continuous Batching / PagedAttention
Des techniques de service qui ajoutent et retirent continuellement des requêtes tout en gérant le cache KV par pages. Elles améliorent utilisation et débit avec des charges de longueur variable.
- request scheduling
- memory paging
- throughput
Speculative Decoding
Une méthode d’inférence où un modèle brouillon plus rapide propose plusieurs jetons, vérifiés en parallèle par le modèle cible. Elle peut réduire la latence sans modifier la distribution cible.
- draft model
- verification
- latency
Open-model Inference Ecosystem
Des moteurs comme vLLM et llama.cpp transforment des poids téléchargeables en inférence locale ou serveur. Leurs priorités diffèrent entre débit, portabilité matérielle, formats et complexité opérationnelle.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
Architecture applicative
Les modèles deviennent des produits grâce aux workflows, outils, échanges de contexte, garde-fous et évaluations. Les rubriques MCP et Outils couvrent cette couche sans la dupliquer ici.
Cas de modèles ouverts
Familles examinées selon le code, les poids, la divulgation de l’entraînement et la licence.
Llama
La famille de Meta à poids téléchargeables a étendu l’inférence locale et le réglage fin. Ses conditions propres à Llama rendent « poids ouverts » plus précis qu’une qualification automatique d’open source au sens de l’OSI.
- open weights
- community license
- model family
Qwen
La famille Qwen d’Alibaba couvre modèles denses, experts routés, multilingues et multimodaux. De nombreux checkpoints sont téléchargeables, mais licence et divulgation doivent être vérifiées modèle par modèle.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
La famille de Mistral AI comprend des modèles denses Mistral et des modèles Mixtral à experts routés. Certaines versions ont une licence permissive, d’autres non ; l’ouverture s’évalue donc artefact par artefact.
- dense models
- MoE
- open weights
DeepSeek
Les versions téléchargeables de DeepSeek ont stimulé l’étude du MoE, du post-entraînement de raisonnement et du service efficace. Code et poids peuvent avoir des licences différentes, tandis que les données constituent un axe distinct.
- MoE
- reasoning
- open weights
Gemma
La famille de Google à poids téléchargeables relie la recherche issue de Gemini au déploiement local, en périphérie ou hébergé. Google parle de modèles ouverts, mais l’usage reste régi par des conditions Gemma.
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 publie la famille OLMo avec ses données de pré-entraînement, son code d’entraînement, ses points de contrôle intermédiaires et ses journaux, en plus des poids. Le premier OLMo est paru en février 2024, OLMo 2 en novembre de la même année, et Olmo 3 en novembre 2025, avec des variantes Base, Instruct et Think en 7B et 32B sous licence Apache 2.0. C’est le cas où les quatre éléments à vérifier séparément — code, poids, informations d’entraînement et licence — sont tous réellement publiés, ce qui en fait un point de repère face aux familles qui ne diffusent que les poids.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
Les gpt-oss-120b et 20b d’OpenAI sont des modèles de raisonnement MoE téléchargeables pour l’inférence locale ou hébergée. Leurs poids et implémentations de référence sous Apache 2.0 élargissent le déploiement, sans publier le jeu de préentraînement lui-même.
- open weights
- reasoning
- MoE
GLM-5
La série GLM-5 de Z.ai est une grande famille de modèles de langage MoE pour le raisonnement, la programmation et le travail agentique de longue haleine. GLM-5 est paru en février 2026, 5.1 en avril, 5.2 en juin avec 753 milliards de paramètres et une fenêtre de contexte d’un million de jetons, et 5.3 en août sur la même base avec des modifications post-entraînement ; le plus petit GLM-5.3-Flash a suivi quelques jours plus tard avec 320 milliards de paramètres au total et 18 milliards actifs. L’échelle des plus grands membres rend l’auto-hébergement coûteux en ressources.
- open weights
- MoE
- long context
Kimi K3
Moonshot AI a publié Kimi K3 en juillet 2026 : un modèle de langage MoE multimodal natif à poids ouverts, doté de 2,8 billions de paramètres au total, 104 milliards actifs et d’un contexte d’un million de jetons. Il vise le code de longue durée, le travail intellectuel et les agents outillés, mais son déploiement local est exigeant.
- open weights
- MoE
- long context
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.