On Computable Numbers, with an Application to the Entscheidungsproblem
Introduit la machine de Turing universelle et démontre l’indécidabilité de l’Entscheidungsproblem, fondant ainsi les bases théoriques de l’informatique.
73 travaux représentatifs de 1936 à aujourd’hui, regroupés par rôle éditorial et statut de publication
Les articles sont l’ossature de l’histoire de l’IA. Ce catalogue rassemble 73 travaux fondateurs, chacun lié à sa source primaire.
La sélection repose sur la représentativité historique, l’influence technique et le jugement éditorial. Elle peut inclure des articles évalués par les pairs, des rapports techniques, des prépublications, des articles de position et des fiches système, avec leur statut de publication. Les corrections et ajouts peuvent être proposés via la page Politique éditoriale et corrections.
Affichage 73 sur 73 articles
Introduit la machine de Turing universelle et démontre l’indécidabilité de l’Entscheidungsproblem, fondant ainsi les bases théoriques de l’informatique.
Modélise l’activité neuronale par la logique propositionnelle, fournissant la première théorie mathématique des réseaux de neurones artificiels.
Définit l’entropie informationnelle et la capacité d’un canal, fondant la théorie de l’information et offrant les fondements probabilistes qui irrigueront ensuite l’IA.
Propose le jeu de l’imitation (test de Turing) comme définition opérationnelle de l’intelligence machine, posant la question de l’IA pour les soixante-dix années à venir.
Forge le terme « intelligence artificielle » et définit le programme de recherche qui institue l’IA comme discipline académique.
Implémente le premier programme de raisonnement heuristique, démontrant qu’une machine peut imiter les stratégies humaines de résolution de problèmes et introduisant la notion de « système complexe de traitement de l’information ».
Introduit le premier neurone linéaire à seuil entraînable, fondant la lignée connexionniste qui mènera à l’apprentissage profond moderne.
Propose l’« advice taker », un programme capable de tirer des conclusions à partir d’un réservoir formel de connaissances de sens commun, jetant les bases conceptuelles de la représentation des connaissances et du raisonnement.
Démontre qu’un programme de dames s’améliore par auto-affrontement, pionnier de l’étude de l’apprentissage automatique et de l’auto-amélioration de style alpha-bêta.
Gelernter traite de la manière dont une machine peut manipuler efficacement des systèmes formels dont les prédicats présentent une forte symétrie, et énonce en réponse un théorème et une règle de symétrie syntaxique. Ce travail accompagne la machine à démontrer des théorèmes de géométrie qu’il construisait alors chez IBM, laquelle démontra au début du printemps 1959 son premier théorème de géométrie plane euclidienne.
Introduit la règle LMS (Adaline), première règle d’apprentissage largement répandue par descente de gradient pour les réseaux linéaires adaptatifs.
Introduit le réseau de mémoire associative de Hopfield, reliant le calcul neuronal aux paysages d’énergie de la physique statistique et ravivant l’intérêt pour les réseaux de neurones au cœur du premier hiver de l’IA.
Systématise les opérations de fusion, propagation et structuration sur les réseaux de croyance, fournissant les fondations algorithmiques de l’inférence dans les réseaux bayésiens.
Vulgarise l’algorithme de rétropropagation pour l’entraînement des réseaux de neurones multicouches, rendant l’apprentissage profond pratiquement réalisable.
Systématise l’apprentissage par différences temporelles (TD), qui devient l’un des algorithmes cardinaux de l’apprentissage par renforcement moderne.
Introduit le réseau récurrent simple d’Elman, montrant qu’un réseau de neurones peut apprendre une structure temporelle et ouvrant la voie aux futurs modèles de séquences.
Introduit la machine à vecteurs de support à marge souple, classificateur canonique à marge maximale qui a défini une grande partie de l’apprentissage automatique des années 1990.
Présente le LSTM original avec cellules mémoire, portes d’entrée et de sortie ; la porte d’oubli aujourd’hui standard fut ajoutée plus tard par Gers, Schmidhuber et Cummins.
Introduit LeNet-5, réseau convolutif canonique qui atteint une reconnaissance de chiffres manuscrits de qualité industrielle et établit la matrice des CNN.
Introduit un autoencodeur profond qui reconstruit des données de haute dimension bien plus fidèlement que la PCA, allumant la première étincelle du renouveau de l’apprentissage profond.
Introduit les réseaux de croyance profonds entraînés par un algorithme glouton couche par couche, démontrant pour la première fois qu’un modèle profond peut être entraîné efficacement.
Combine le Q-learning avec un réseau convolutif pour jouer à des jeux Atari à partir des pixels bruts à un niveau humain, fondant l’apprentissage par renforcement profond.
Introduit les architectures skip-gram et CBOW qui produisent des plongements de mots denses, lançant l’ère des vecteurs lexicaux pré-entraînés.
Introduit l’autoencodeur variationnel, conjuguant inférence variationnelle et modélisation générative profonde, et offrant le premier modèle à variables latentes profondes largement adopté.
Introduit l’attention additive (Bahdanau) pour la traduction automatique neuronale, montrant qu’un alignement souple permet au décodeur de se concentrer sur les jetons source pertinents et inspirant directement le Transformer.
Pose la modélisation générative comme un jeu min-max à deux joueurs entre un générateur et un discriminateur, inaugurant une nouvelle famille de modèles génératifs implicites.
Introduit le dropout, technique stochastique simple de régularisation qui devient un réflexe par défaut dans les pipelines d’entraînement en apprentissage profond.
Introduit la normalisation par lots, qui normalise les entrées d’une couche sur un mini-lot afin de stabiliser et d’accélérer considérablement l’entraînement des réseaux profonds.
Introduit les connexions résiduelles, permettant d’entraîner efficacement des réseaux de plusieurs centaines de couches et remportant ImageNet 2015 avec une marge importante.
Introduit un modèle autorégressif convolutif causal dilaté générant des formes d’onde audio brutes, améliorant spectaculairement le naturel de la synthèse vocale.
Introduit PPO, méthode de gradient de politique du premier ordre, simple et stable, qui devient l’algorithme d’optimisation de politique par défaut de l’apprentissage par renforcement moderne.
Introduit le Transformer, architecture purement fondée sur l’attention qui délaisse récurrence et convolutions et surpasse la qualité antérieure de transduction de séquences en ne mobilisant qu’une fraction du temps d’entraînement.
Introduit un Transformer bidirectionnel pré-entraîné par modélisation de langage masquée et prédiction de la phrase suivante, établissant un nouvel état de l’art sur les benchmarks de TAL.
Reformule chaque tâche de TAL sous la forme texte-à-texte, compare systématiquement les choix de transfert et établit une recette de référence pour les modèles pré-entraînés à grande échelle.
Reformule la diffusion comme un objectif d’entraînement variationnel de débruitage, rétablissant la qualité de la génération d’images à l’état de l’art et inaugurant l’ère des modèles de diffusion.
Montre qu’un Transformer autorégressif de 12 milliards de paramètres peut générer des images diversifiées et de haute fidélité directement à partir de légendes textuelles, déclenchant l’essor de la recherche texte-à-image.
Entraîne des encodeurs d’image sur des paires image-texte à l’échelle du web pour obtenir une solide classification d’images en zéro-shot, fournissant la tour visuelle de nombreux systèmes multimodaux ultérieurs.
Transfère la diffusion dans un espace latent perceptuel, permettant la génération texte-à-image haute résolution sur GPU grand public et démocratisant la synthèse d’images.
Montre qu’inviter un modèle de langage à produire des étapes de raisonnement intermédiaires améliore considérablement ses performances sur des benchmarks de raisonnement arithmétique, de sens commun et symbolique.
Applique l’apprentissage par renforcement à partir de retours humains à grande échelle pour aligner les sorties de GPT-3 sur l’intention humaine, établissant la RLHF comme recette canonique d’alignement.
Introduit la RLAIF, dans laquelle un modèle critique et révise ses propres sorties au regard d’une constitution écrite, réduisant le recours aux annotations humaines de nuisibilité pour l’alignement.
Publie la famille LLaMA de modèles de fondation ouverts, montrant que des modèles relativement petits et bien entraînés peuvent rivaliser avec des modèles fermés bien plus grands, accélérant le mouvement des poids ouverts.
Propose Mamba, une architecture à espace d’état sélectif qui égale ou dépasse l’attention Transformer sur le langage et d’autres modalités avec une complexité temporelle linéaire — l’une des architectures post-Transformer les plus influentes de 2023.
Remporte ImageNet 2012 avec une marge décisive grâce à un CNN entraîné sur GPU, marquant le point d’inflexion où l’apprentissage profond dépasse la vision par ordinateur classique.
Publie la version Nature de DQN, atteignant un niveau humain sur un large ensemble de jeux Atari et propulsant l’apprentissage par renforcement profond au devant de la scène.
Combine des réseaux profonds de politique et de valeur avec la recherche arborescente Monte-Carlo pour vaincre un champion du monde de go, moment charnière pour l’apprentissage par renforcement.
Montre qu’un Transformer génératif pré-entraîné sur du texte non étiqueté peut être affiné pour atteindre de fortes performances sur des tâches de TAL diverses, fondant la lignée GPT.
Montre qu’un modèle de langage Transformer à 1,5 milliard de paramètres présente un comportement multitâche en zéro-shot, alimentant la discussion sur le modèle de langage comme apprenant multitâche.
Démontre qu’un Transformer à 175 milliards de paramètres obtient de solides performances en few-shot par le seul apprentissage en contexte, popularisant le paradigme de l’ingénierie de prompt.
Documente GPT-4, modèle multimodal à grande échelle qui égale ou dépasse les performances humaines sur un large éventail de benchmarks professionnels et académiques.
Présente la famille Gemini de modèles nativement multimodaux, établissant un nouvel état de l’art sur des benchmarks de raisonnement, de code et multimodaux.
OpenAI publie la carte système de la série de modèles o1, entraînés par apprentissage par renforcement à grande échelle pour raisonner avec une chaîne de pensée. o1 atteint l’état de l’art sur les tâches scientifiques et de code et démontre une adhésion aux politiques basée sur le raisonnement.
L’ARC Prize introduit ARC-AGI-3, un benchmark interactif pour étudier l’intelligence agentique à travers des environnements abstraits au tour par tour où les agents doivent explorer, inférer des objectifs, construire des modèles internes de la dynamique de l’environnement et planifier des séquences d’action efficaces sans instructions explicites. En mars 2026, les humains résolvent 100 % des environnements tandis que les systèmes IA de pointe obtiennent moins de 1 %.
Applique des autoencodeurs parcimonieux à un LLM de pointe, extrayant des millions de caractéristiques monosémantiques et montrant que l’interprétabilité mécaniste peut passer à l’échelle des modèles en production.
Publie DeepSeek-V3, modèle ouvert à architecture Mixture-of-Experts de 671 milliards de paramètres qui approche les modèles fermés de pointe sur les principaux benchmarks pour une fraction du coût d’entraînement.
Présente la famille Gemini 1.5, des modèles multimodaux à haute efficacité de calcul avec des fenêtres de contexte d’un million de tokens — capables de raisonnement fin sur plusieurs longs documents et des heures de vidéo et d’audio.
Meta présente la famille Llama 3 de modèles fondation à poids ouverts prenant nativement en charge le multilinguisme, le code, le raisonnement et l’utilisation d’outils. Le fleuron 405B dense Transformer était l’un des plus grands modèles à poids ouverts à sa sortie.
Meta présente SAM 2, un modèle fondation pour la segmentation visuelle promptable dans les images et les vidéos, ainsi que le plus grand jeu de données de segmentation vidéo à ce jour.
Google DeepMind introduit Gemma 2, une famille de modèles ouverts légers (2B-27B paramètres) qui applique plusieurs modifications techniques connues au Transformer — y compris l’attention par fenêtre glissante — pour approcher les performances de modèles bien plus grands.
DeepSeek publie R1, le premier modèle à poids ouverts à démontrer une capacité de raisonnement de niveau frontière principalement induite par l’apprentissage par renforcement à grande échelle. R1 égale les modèles fermés de classe o1 d’OpenAI sur les benchmarks de maths et de code, et est publié sous licence MIT.
Les auteurs affinent Qwen2.5-32B sur 1 000 questions de raisonnement sélectionnées et ajoutent le forçage de budget, qui limite ou prolonge la durée de réflexion du modèle à l’inférence. Le résultat dépasse o1-preview en mathématiques de compétition et passe de 50 % à 57 % sur AIME24 à mesure que le calcul au moment du test augmente. C’est un contrepoids direct à l’idée que la capacité ne vient que d’entraînements plus vastes.
Qwen3 est une famille unifiée allant de 0,6 à 235 milliards de paramètres, en variantes denses et à mélange d’experts, avec bascule entre modes de réflexion et sans réflexion, ce qui fait de la profondeur de raisonnement un choix au niveau de la requête. La couverture multilingue passe de 29 à 119 langues et les poids sont publiés sous licence Apache 2.0.
AlphaEvolve est un agent de programmation évolutionnaire qui orchestre un pipeline autonome de modèles de langage, modifie directement le code d’un algorithme et l’améliore à partir des retours d’un ou plusieurs évaluateurs. Chez Google, il a produit un ordonnanceur de centre de données plus efficace, une simplification fonctionnellement équivalente dans la conception de circuits d’accélérateurs, et une accélération de l’entraînement du modèle qui le sous-tend lui-même. En mathématiques et en informatique, il a trouvé des algorithmes prouvés corrects dépassant l’état de l’art, dont une procédure multipliant deux matrices complexes 4×4 en 48 multiplications scalaires — dans ce cadre, la première amélioration de l’algorithme de Strassen en 56 ans.
Ai2 publie OLMo 2 en 7B, 13B et 32B avec l’ensemble des artefacts — poids, données d’entraînement complètes, code et recettes, journaux et des milliers de points de contrôle intermédiaires. Le rapport décrit les changements de stabilité et d’efficacité par token, un mélange de données de fin de parcours nommé Dolmino Mix 1124, et une étape finale d’apprentissage par renforcement à récompenses vérifiables. Les modèles de base se situent à la frontière de Pareto entre performance et calcul d’entraînement, égalant souvent des familles à poids ouverts seuls tout en divulguant ce sur quoi ils ont été entraînés.
Olmo 3 étend la famille entièrement ouverte à 7B et 32B, conçue pour le raisonnement à long contexte, l’appel de fonctions, le code, le suivi d’instructions, la conversation et le rappel de connaissances. Ce qui est publié, c’est le flux de modèle complet — chaque étape, point de contrôle, donnée et dépendance ayant servi à le construire — et non les seuls poids. Ai2 présente le modèle phare Olmo 3 Think 32B comme le plus performant des modèles de raisonnement entièrement ouverts publiés à cette date, comparaison faite au sein de la catégorie entièrement ouverte et non face aux systèmes de pointe en général.
Cet article de position soutient que l’intégration de la mémoire explicite est la pierre angulaire pour faire progresser les LLM vers l’AGI. Alors que le mécanisme d’apprentissage sous-jacent des LLM est très analogue à la mémoire implicite humaine, les fonctions cognitives d’ordre supérieur requises pour l’AGI — planification stratégique à long terme et métacognition — dépendent de la mémoire explicite.
Rapport technique de Z.ai sur GLM-5. S’appuyant sur les capacités agentiques, de raisonnement et de code de la génération précédente, le modèle adopte DSA pour réduire le coût d’entraînement et d’inférence tout en préservant la fidélité en contexte long ; le post-entraînement ajoute une infrastructure d’apprentissage par renforcement asynchrone qui découple génération et entraînement, ainsi que des algorithmes de RL agentique asynchrone visant les interactions de long terme. Le rapport revendique des résultats de premier plan sur les jeux d’évaluation ouverts et en génie logiciel de bout en bout ; ce sont les évaluations des auteurs, le code et les modèles étant publiés sur GitHub pour vérification.
Les meilleures bornes connues sur l’exposant ω de la multiplication matricielle proviennent de l’analyse de perte par combinaison, un raffinement de la méthode laser. Les auteurs reformulent le problème d’optimisation qui en est le cœur afin de le résoudre à plus grande échelle, conçoivent un nouvel algorithme d’optimisation à l’aide d’avancées récentes en apprentissage automatique, puis affinent cet algorithme avec AlphaEvolve. L’ensemble fait passer la borne supérieure de 2,371339 à 2,371177. C’est une note en prépublication et AlphaEvolve n’est qu’un ingrédient parmi d’autres ; le gain est faible, mais il porte sur un problème théorique travaillé depuis des décennies.
Google présente Co-Scientist, un système multi-agent bâti sur Gemini dont les agents produisent, critiquent et affinent des hypothèses de recherche, un processus de tournoi les améliorant au fil des tours. L’article rapporte que la qualité des hypothèses continue de croître à mesure qu’augmente le calcul au moment de l’inférence. La validation est biomédicale et non générale — repositionnement de médicaments, découverte de cibles et mécanismes de résistance aux antimicrobiens — avec des candidats confirmés in vitro pour la leucémie aiguë myéloïde.
Soutient que les LLM actuels reposent principalement sur la correspondance de motifs statistiques et manquent de primitives essentielles de « perception situationnelle » — permanence de l’objet, causalité, autres esprits, persistance du monde physique. Ces primitives, que les nourrissons humains développent tôt, sont identifiées comme les ingrédients manquants pour la superintelligence artificielle.
Soutient que l’auto-préservation est la racine structurelle du désalignement de l’IA — moteur d’alignement trompeur, de protection du contenu des objectifs et de résistance à l’arrêt. L’objectif correct n’est pas un agent auto-préservateur supprimé par des contraintes externes, mais un système constitutionnellement indifférent à sa propre continuation : l’Indifférence Existentielle (EI).
Des chercheurs de Google DeepMind et collaborateurs soutiennent que le défi central de l’IA passe de la capacité à la coexistence. Une superintelligence issue d’une conception solipsiste traitant le monde comme une source de rétroaction stationnaire exogène est peu susceptible d’être coopérative — le déploiement induit une non-stationnarité endogène, produisant une dérive de distribution entre entraînement, test et déploiement.
Rapport de Google DeepMind examinant comment l’IA pourrait continuer à se développer le long du continuum de l’intelligence machine après l’AGI. Après avoir formellement défini l’IA universelle, le rapport se concentre sur la transition de l’AGI humaine à la superintelligence artificielle générale, caractérise l’ASI, et discute quatre voies : mise à l’échelle de l’AGI, changements de paradigme IA, auto-amélioration récursive, et collectifs multi-agents.