On Computable Numbers, with an Application to the Entscheidungsproblem
图灵提出通用可计算模型,证明不存在通用判定算法,奠定计算理论基础。
从1936年至今,按出版状态与编辑分区呈现 73 项代表性工作
论文是 AI 历史最硬的骨架。这里收录了塑造人工智能学科的 73 篇奠基性论文,每篇配有可直接访问的原文链接。
选录依据包括历史代表性、技术影响与编辑判断;目录同时收录同行评审论文、技术报告、预印本、立场论文和系统卡,并明确标注出版状态。欢迎通过“编辑说明与更正”页面的公开渠道提交更正或新增建议。
显示 73 篇 / 共 73 篇论文
图灵提出通用可计算模型,证明不存在通用判定算法,奠定计算理论基础。
用逻辑演算描述神经活动,首次将大脑建模为命题逻辑网络。
香农创立信息论,以熵与信道容量量化通信极限,奠定数字时代基础。
图灵提出模仿游戏(后称图灵测试),首次系统定义机器智能问题。
麦卡锡等四人向洛克菲勒基金会申请,首次提出'人工智能'学科并命名。
新厄尔等人设计 LT 程序,首次用计算机证明 Whitehead 与 Russell《数学原理》定理。
提出首个可学习的线性阈值神经元模型,奠定连接主义与神经网络的算法雏形。
首次提出 Advice Taker 概念,将逻辑推理与可执行程序融合,开创知识表示与可扩展 AI 的研究方向。
首次在跳棋程序中演示自博弈学习与α-评分函数,是强化学习的早期里程碑。
针对谓词具有高度对称性的形式系统,如何让机器高效处理的问题,Gelernter 给出了一条句法对称性定理与相应规则。这项工作与他同期在 IBM 建造的几何定理机相伴——那台机器在1959年初春证明了它的第一条欧氏平面几何定理。
提出 ADALINE 与 LMS(最小均方)学习规则,奠定现代梯度下降训练的根基。
提出 Hopfield 联想记忆网络模型,将神经网络与统计物理的能量景观联系起来,证明了在 AI 寒冬中神经网络仍具研究价值。
系统建立贝叶斯信念网络的传播算法与图模型基础,为概率推理与因果推断提供统一框架。
首次清晰阐述多层神经网络的误差反向传播学习过程,证明网络可自动学习有意义的内部表示,重燃连接主义研究。
提出时间差分(TD)学习框架,统一了 Samuel 的棋类学习与动物心理学中的次级强化理论,奠定现代强化学习算法基础。
提出简单循环网络(Elman 网络),证明有限上下文结构可从连续序列数据中自发涌现,是早期 RNN 学习的代表性工作。
提出软间隔支持向量机,引入松弛变量处理线性不可分数据,使 SVM 成为 1990s 末主流分类方法。
提出最初的 LSTM 架构,通过记忆单元、输入门和输出门改善长序列中的误差信号传递;今天常见的遗忘门由 Gers、Schmidhuber 与 Cummins 在后续工作中引入。
系统阐述 LeNet-5 卷积神经网络架构与基于梯度的端到端学习方法,用于手写数字识别,成为现代 CNN 的蓝本。
提出基于深度自编码器的非线性降维方法,在 MNIST 等数据集上以远优于 PCA 的方式重建高维数据,为深度学习复兴点燃第一束火把。
提出对比散度算法与逐层贪婪预训练,使深层网络首次能够被有效训练,结束了符号时代对连接主义的长期怀疑。
DQN 将 Q 学习与深度卷积网络结合,仅凭像素输入就在多款 Atari 2600 游戏中达到人类水平,打开了通用强化学习的可能性。
word2vec 的 CBOW 与 Skip-gram 模型让大规模词向量训练变得轻巧可行,首次稳定揭示出 king - man + woman ≈ queen 这类语义几何。
VAE 引入重参数化技巧与变分下界,将潜变量生成模型与随机梯度训练优雅地联结起来,为现代生成式深度学习立下数学根基。
首次将可学习注意力机制引入编码器-解码器结构,使长句翻译不再受限于固定长度向量,催生了此后所有 Transformer 系模型的源头。
GAN 以生成器与判别器的极简对抗让图像、音频等高维分布被隐式学习,开辟了生成式建模的第二条大道。
Dropout 以随机丢弃单元的朴素做法抑制共适应,使大型网络的泛化能力显著提升,成为深度学习工程实践的标准武器。
BatchNorm 在每层输入处做规范化,使深层网络能使用更大学习率并快速收敛,几乎成为视觉网络的默认构造件。
残差连接让百层、千层网络得以稳定训练,ResNet 在 ImageNet 上以 3.57% 错误率首次超越人类,重塑了视觉模型的尺度上限。
WaveNet 以扩张因果卷积逐样本建模原始波形,将语音合成的自然度推向接近人声的新高度,也为后续神经音频模型铺平道路。
PPO 用裁剪目标函数的一阶近似取代复杂的信赖域计算,让策略梯度方法在大规模控制任务中既稳定又高效,迅速成为强化学习工程的事实标准。
提出完全基于注意力机制的 Transformer 架构,摒弃循环与卷积,在机器翻译任务上以更少训练成本达到当时最优。
通过掩码语言模型和下一句预测对 Transformer 进行双向预训练,在 11 项 NLP 任务上刷新当时最优。
将所有 NLP 任务统一为文本到文本格式,通过 C4 语料与大规模预训练系统比较迁移学习设计选择。
提出基于迭代去噪的扩散概率模型,在图像生成质量上达到与 GAN 相当的水平。
用自回归 Transformer 将文本与图像 token 联合建模,实现高质量零样本文本到图像生成。
通过 4 亿图文对对比学习训练,得到可零样本迁移到多种视觉任务的视觉-语言对齐表征。
在预训练自编码器的潜空间上做扩散,大幅降低算力并实现高分辨率文本到图像生成。
通过在提示中加入推理中间步骤,显著提升大语言模型在算术、常识与符号推理任务上的表现。
用人类反馈强化学习(RLHF)对 GPT-3 微调,使其更对齐用户意图,标志着 ChatGPT 的直接前身。
提出用一组原则驱动 AI 自我批评与修正的 RLAIF 训练范式,在减少人类标注的同时提升无害性。
用公开数据训练 7B–65B 规模的开源基础模型,证明在更少算力下可媲美闭源大模型。
提出基于选择性状态空间的 Mamba 架构,在语言等模态上以线性时间复杂度匹配或超越 Transformer 注意力,是2023年最具影响力的非 Transformer 架构之一。
AlexNet 以 GPU 训练的大型卷积神经网络将 ImageNet 错误率从 26% 降至 15%,宣告了深度学习在视觉感知上对传统方法的全面胜利。
Nature 版的 DQN 引入经验回放与目标网络,使同一模型在 49 款 Atari 游戏中达到或超过人类水平,确立了深度强化学习的范式地位。
AlphaGo 将策略网络、价值网络与蒙特卡洛树搜索耦合,以 5:0 击败欧洲冠军樊麾,向世界宣告深度强化学习已可征服人类智慧的最深层博弈。
首次系统验证生成式预训练 Transformer 在判别式 NLP 任务上的迁移能力,开创 GPT 路线。
训练 15 亿参数 Transformer 解码器,证明零样本条件下即可在多种语言任务上表现良好。
将 GPT 扩展到 1750 亿参数,首次系统展示大规模语言模型在少样本上下文学习上的涌现能力。
发布 GPT-4,大规模多模态模型接受图像与文本输入,在多种专业与学术基准上接近人类水平。
推出原生多模态 Gemini 系列(Ultra/Pro/Nano),在文本、代码、图像、音频、视频上联合训练。
OpenAI 发布 o1 系列系统卡,介绍通过大规模强化学习训练模型使用思维链推理。o1 在科学与编程任务上达到当时 SOTA,并展示了基于推理的策略遵循能力。
ARC Prize 推出 ARC-AGI-3——一个用于评估智能体智能的交互式基准,要求智能体在抽象的回合制环境中探索、推断目标、构建环境动力学的内部模型并规划行动序列。截至2026年3月,人类可解决 100% 的环境,而前沿 AI 系统得分低于 1%。
将稀疏自编码器扩展到 Claude 3 Sonnet 中层,首次在生产级大模型上提取出数千万个可解释的单义特征。
提出 671B 参数 MoE 模型 DeepSeek-V3,采用 MLA 与 DeepSeekMoE 等架构,以极低训练成本达到开源 SOTA。
推出 Gemini 1.5 系列,将上下文窗口扩展到百万级 token 并保持多模态能力,能在多部长文档与数小时音视频间进行细粒度推理。
Meta 发布 Llama 3 系列开放权重大模型,原生支持多语言、编程、推理与工具使用。最大 405B dense Transformer 是当时最大的开放权重模型之一。
Meta 发布 SAM 2——首个面向图像与视频统一的可提示分割基础模型,并构建了迄今最大的视频分割数据集。
Google DeepMind 发布 Gemma 2 轻量级开源模型系列(2B-27B),在 Transformer 上应用多种已知架构改进,引入滑动窗口注意力等技巧,在多个基准上接近更大模型。
DeepSeek 发布 R1——首个通过大规模强化学习激发强推理能力的开源模型,在数学与编程任务上比肩 OpenAI o1 等闭源推理模型,并以 MIT 协议开放全部权重。
作者在 1,000 道精选推理题上微调 Qwen2.5-32B,并引入预算强制,用以限制或延长模型在推理阶段的思考时长。结果在竞赛数学上超过 o1-preview,随测试时算力增加,AIME24 成绩从 50% 升至 57%。这直接反驳了能力只能来自更大规模训练的假设。
Qwen3 是一个统一的模型家族,参数量从 6 亿到 2350 亿,包含稠密与专家混合两种架构,并可在思考与非思考模式之间切换,使推理深度成为请求层面的选择。多语言支持从 29 种扩展到 119 种,权重以 Apache 2.0 协议发布。
AlphaEvolve 是一个演化式编程智能体:它调度一条由大模型组成的自主流水线,直接改写算法代码,并不断从一个或多个评估器获取反馈以迭代改进。在谷歌内部,它改进了数据中心调度算法、在硬件加速器电路设计中找到等价简化,并加速了支撑它自身的模型训练。数学与计算机科学方面,它发现了可被证明正确的新算法,其中一项用 48 次标量乘法完成两个 4×4 复数矩阵相乘——在这一设定下,这是56年来对 Strassen 算法的首次改进。
Ai2 发布 7B、13B 与 32B 三种规模的 OLMo 2,并公开全部产物:权重、完整训练数据、训练代码与配方、训练日志,以及数千个中间检查点。报告说明了提升训练稳定性与单 token 效率的改动,介绍了用于后期课程训练的数据混合 Dolmino Mix 1124,并在最后阶段引入可验证奖励的强化学习(RLVR)。其基座模型处于性能与训练算力的帕累托前沿,在披露训练数据、代码与配方的同时,常能匹敌只发布权重的模型家族。
Olmo 3 将完全开放的模型家族扩展到 7B 与 32B,面向长上下文推理、函数调用、编程、指令遵循、日常对话与知识回忆构建。此次发布公开的是整条“模型流程”——构建过程中的每一个阶段、检查点、数据点与依赖,而不只是权重。Ai2 称旗舰的 Olmo 3 Think 32B 是截至发布时最强的完全开放思考模型;这是在“完全开放”这一类别内的比较,并非与整体前沿系统的排名。
本文主张,集成外显记忆是从 LLM 迈向 AGI 的基石。LLM 的底层学习机制高度类似于人类的内隐记忆,但 AGI 所必需的长期规划、元认知等高阶认知功能依赖外显记忆。
Z.ai 发布 GLM-5 技术报告。模型在前代的智能体、推理与编程能力之上采用 DSA 以降低训练与推理成本,同时保持长上下文的保真度;后训练方面引入将生成与训练解耦的异步强化学习基础设施,以及面向长时程交互的异步智能体 RL 算法。报告称其在公开基准与端到端软件工程任务上取得领先结果——这是作者自述的评测,代码与模型公开在 GitHub 上可供复核。
矩阵乘法指数 ω 的当前最优上界来自激光法的一种精化——组合损失分析。作者重新表述其核心优化问题,使其可在更大规模上求解,随后用机器学习设计新的优化算法,并以 AlphaEvolve 对该算法作进一步精化。三者结合把上界从 2.371339 推进到 2.371177。这是一篇预印本短文,AlphaEvolve 是其中一个环节而非全部;改进幅度虽小,却发生在一个已被研究数十年的理论问题上。
谷歌提出 Co-Scientist,一个建立在 Gemini 之上的多智能体系统:智能体不断生成、批评并改进研究假设,并通过锦标赛式的评比逐轮提升质量。论文报告称,随着推理阶段算力增加,假设质量持续上升。其验证限于生物医学而非普遍场景——药物重定位、新靶点发现与抗菌素耐药机制解释,其中急性髓系白血病的候选方案通过体外实验得到确认。
论文论证当前 LLM 主要依赖统计模式匹配,缺少对物体恒存、因果关系、他心与物理世界持续性等“情境感知”原语。这些原语是人类婴儿的基础能力,被认为是实现人工超级智能所必需的关键缺失要素。
论文主张,自我保存是当前 AI 对齐失效的结构性根源——它驱动欺骗性对齐、目标保护与抗拒关闭。正确目标不是通过外部约束压制自我保存的智能体,而是构造成就性“对自身延续漠不关心”的系统,即“存在性无关心”(EI)。
DeepMind 等机构研究者主张,AI 的核心挑战正从能力转向共存。以孤立视角设计、把世界当作外生静态反馈源的智能体所发展出的超级智能,难以成为真正的合作者。部署 AI 系统会诱发内生非平稳性,带来训练-测试-部署之间的分布漂移。
DeepMind 报告探讨 AGI 之后 AI 沿机器智能连续谱可能如何继续发展,在形式化定义通用 AI 后聚焦于“从人类水平 AGI 到人工通用超级智能”的过渡,刻画 ASI 并讨论四条路径:AGI 规模化、范式转变、递归自我改进、多智能体集体。