简体中文
← 返回首页
时代:
年代:
主题:

显示 73 篇 / 共 73 篇论文

基础论文

1956 期刊论文 AI 的诞生

The Logic Theory Machine

新厄尔等人设计 LT 程序,首次用计算机证明 Whitehead 与 Russell《数学原理》定理。

1958 会议论文 AI 的诞生

具有常识的程序

首次提出 Advice Taker 概念,将逻辑推理与可执行程序融合,开创知识表示与可扩展 AI 的研究方向。

1959 期刊论文 AI 的诞生

关于句法对称性与机器操作形式系统的一则注记

针对谓词具有高度对称性的形式系统,如何让机器高效处理的问题,Gelernter 给出了一条句法对称性定理与相应规则。这项工作与他同期在 IBM 建造的几何定理机相伴——那台机器在1959年初春证明了它的第一条欧氏平面几何定理。

1986 期刊论文 AI 寒冬

通过误差反向传播学习表示

首次清晰阐述多层神经网络的误差反向传播学习过程,证明网络可自动学习有意义的内部表示,重燃连接主义研究。

1990 期刊论文 AI 寒冬

在时间中寻找结构

提出简单循环网络(Elman 网络),证明有限上下文结构可从连续序列数据中自发涌现,是早期 RNN 学习的代表性工作。

1995 期刊论文 复兴时代

支持向量网络

提出软间隔支持向量机,引入松弛变量处理线性不可分数据,使 SVM 成为 1990s 末主流分类方法。

1997 期刊论文 复兴时代

长短期记忆网络

提出最初的 LSTM 架构,通过记忆单元、输入门和输出门改善长序列中的误差信号传递;今天常见的遗忘门由 Gers、Schmidhuber 与 Cummins 在后续工作中引入。

1998 期刊论文 复兴时代

基于梯度的学习应用于文档识别

系统阐述 LeNet-5 卷积神经网络架构与基于梯度的端到端学习方法,用于手写数字识别,成为现代 CNN 的蓝本。

2006 期刊论文 复兴时代

用神经网络降低数据维度

提出基于深度自编码器的非线性降维方法,在 MNIST 等数据集上以远优于 PCA 的方式重建高维数据,为深度学习复兴点燃第一束火把。

2006 期刊论文 复兴时代

深度信念网络的快速学习算法

提出对比散度算法与逐层贪婪预训练,使深层网络首次能够被有效训练,结束了符号时代对连接主义的长期怀疑。

2013 会议论文 复兴时代

用深度强化学习玩 Atari 游戏

DQN 将 Q 学习与深度卷积网络结合,仅凭像素输入就在多款 Atari 2600 游戏中达到人类水平,打开了通用强化学习的可能性。

2013 会议论文 复兴时代

向量空间中词表示的高效估计

word2vec 的 CBOW 与 Skip-gram 模型让大规模词向量训练变得轻巧可行,首次稳定揭示出 king - man + woman ≈ queen 这类语义几何。

2013 会议论文 复兴时代

自编码变分贝叶斯

VAE 引入重参数化技巧与变分下界,将潜变量生成模型与随机梯度训练优雅地联结起来,为现代生成式深度学习立下数学根基。

2014 会议论文 复兴时代

通过联合学习对齐与翻译的神经机器翻译

首次将可学习注意力机制引入编码器-解码器结构,使长句翻译不再受限于固定长度向量,催生了此后所有 Transformer 系模型的源头。

2014 会议论文 复兴时代

生成对抗网络

GAN 以生成器与判别器的极简对抗让图像、音频等高维分布被隐式学习,开辟了生成式建模的第二条大道。

2014 期刊论文 复兴时代

Dropout:防止神经网络过拟合的简单方法

Dropout 以随机丢弃单元的朴素做法抑制共适应,使大型网络的泛化能力显著提升,成为深度学习工程实践的标准武器。

2015 会议论文 复兴时代

用于图像识别的深度残差学习

残差连接让百层、千层网络得以稳定训练,ResNet 在 ImageNet 上以 3.57% 错误率首次超越人类,重塑了视觉模型的尺度上限。

2016 会议论文 复兴时代

WaveNet:一种原始音频的生成模型

WaveNet 以扩张因果卷积逐样本建模原始波形,将语音合成的自然度推向接近人声的新高度,也为后续神经音频模型铺平道路。

2017 预印本 复兴时代

近端策略优化算法

PPO 用裁剪目标函数的一阶近似取代复杂的信赖域计算,让策略梯度方法在大规模控制任务中既稳定又高效,迅速成为强化学习工程的事实标准。

2017 会议论文 复兴时代

Attention Is All You Need

提出完全基于注意力机制的 Transformer 架构,摒弃循环与卷积,在机器翻译任务上以更少训练成本达到当时最优。

2021 会议论文 大模型时代

Zero-Shot Text-to-Image Generation

用自回归 Transformer 将文本与图像 token 联合建模,实现高质量零样本文本到图像生成。

里程碑系统与成果

2015 期刊论文 复兴时代

通过深度强化学习实现人类水平的控制

Nature 版的 DQN 引入经验回放与目标网络,使同一模型在 49 款 Atari 游戏中达到或超过人类水平,确立了深度强化学习的范式地位。

2016 期刊论文 复兴时代

用深度神经网络与树搜索掌握围棋

AlphaGo 将策略网络、价值网络与蒙特卡洛树搜索耦合,以 5:0 击败欧洲冠军樊麾,向世界宣告深度强化学习已可征服人类智慧的最深层博弈。

2020 会议论文 大模型时代

Language Models are Few-Shot Learners

将 GPT 扩展到 1750 亿参数,首次系统展示大规模语言模型在少样本上下文学习上的涌现能力。

2023 技术报告 大模型时代

GPT-4 Technical Report

发布 GPT-4,大规模多模态模型接受图像与文本输入,在多种专业与学术基准上接近人类水平。

2024 系统卡 大模型时代

OpenAI o1 系统卡

OpenAI 发布 o1 系列系统卡,介绍通过大规模强化学习训练模型使用思维链推理。o1 在科学与编程任务上达到当时 SOTA,并展示了基于推理的策略遵循能力。

2026 预印本 大模型时代

ARC-AGI-3:面向前沿智能体智能的新挑战

ARC Prize 推出 ARC-AGI-3——一个用于评估智能体智能的交互式基准,要求智能体在抽象的回合制环境中探索、推断目标、构建环境动力学的内部模型并规划行动序列。截至2026年3月,人类可解决 100% 的环境,而前沿 AI 系统得分低于 1%。

近期研究

2024 技术报告 大模型时代

DeepSeek-V3 Technical Report

提出 671B 参数 MoE 模型 DeepSeek-V3,采用 MLA 与 DeepSeekMoE 等架构,以极低训练成本达到开源 SOTA。

2024 预印本 大模型时代

Llama 3 模型群

Meta 发布 Llama 3 系列开放权重大模型,原生支持多语言、编程、推理与工具使用。最大 405B dense Transformer 是当时最大的开放权重模型之一。

2024 预印本 大模型时代

SAM 2:图像与视频的可提示分割

Meta 发布 SAM 2——首个面向图像与视频统一的可提示分割基础模型,并构建了迄今最大的视频分割数据集。

2024 预印本 大模型时代

Gemma 2:实用规模的开源语言模型改进

Google DeepMind 发布 Gemma 2 轻量级开源模型系列(2B-27B),在 Transformer 上应用多种已知架构改进,引入滑动窗口注意力等技巧,在多个基准上接近更大模型。

2025 预印本 大模型时代

DeepSeek-R1:通过强化学习激发 LLM 推理能力

DeepSeek 发布 R1——首个通过大规模强化学习激发强推理能力的开源模型,在数学与编程任务上比肩 OpenAI o1 等闭源推理模型,并以 MIT 协议开放全部权重。

2025 预印本 大模型时代

s1:简单的测试时扩展

作者在 1,000 道精选推理题上微调 Qwen2.5-32B,并引入预算强制,用以限制或延长模型在推理阶段的思考时长。结果在竞赛数学上超过 o1-preview,随测试时算力增加,AIME24 成绩从 50% 升至 57%。这直接反驳了能力只能来自更大规模训练的假设。

2025 预印本 大模型时代

Qwen3 技术报告

Qwen3 是一个统一的模型家族,参数量从 6 亿到 2350 亿,包含稠密与专家混合两种架构,并可在思考与非思考模式之间切换,使推理深度成为请求层面的选择。多语言支持从 29 种扩展到 119 种,权重以 Apache 2.0 协议发布。

2025 预印本 大模型时代

AlphaEvolve:面向科学与算法发现的编程智能体

AlphaEvolve 是一个演化式编程智能体:它调度一条由大模型组成的自主流水线,直接改写算法代码,并不断从一个或多个评估器获取反馈以迭代改进。在谷歌内部,它改进了数据中心调度算法、在硬件加速器电路设计中找到等价简化,并加速了支撑它自身的模型训练。数学与计算机科学方面,它发现了可被证明正确的新算法,其中一项用 48 次标量乘法完成两个 4×4 复数矩阵相乘——在这一设定下,这是56年来对 Strassen 算法的首次改进。

2025 期刊论文 大模型时代

2 OLMo 2 Furious

Ai2 发布 7B、13B 与 32B 三种规模的 OLMo 2,并公开全部产物:权重、完整训练数据、训练代码与配方、训练日志,以及数千个中间检查点。报告说明了提升训练稳定性与单 token 效率的改动,介绍了用于后期课程训练的数据混合 Dolmino Mix 1124,并在最后阶段引入可验证奖励的强化学习(RLVR)。其基座模型处于性能与训练算力的帕累托前沿,在披露训练数据、代码与配方的同时,常能匹敌只发布权重的模型家族。

2025 预印本 大模型时代

Olmo 3

Olmo 3 将完全开放的模型家族扩展到 7B 与 32B,面向长上下文推理、函数调用、编程、指令遵循、日常对话与知识回忆构建。此次发布公开的是整条模型流程——构建过程中的每一个阶段、检查点、数据点与依赖,而不只是权重。Ai2 称旗舰的 Olmo 3 Think 32B 是截至发布时最强的完全开放思考模型;这是在完全开放这一类别内的比较,并非与整体前沿系统的排名。

2026 预印本 大模型时代

立场:海马体外显记忆是 AGI 的基石

本文主张,集成外显记忆是从 LLM 迈向 AGI 的基石。LLM 的底层学习机制高度类似于人类的内隐记忆,但 AGI 所必需的长期规划、元认知等高阶认知功能依赖外显记忆。

2026 预印本 大模型时代

GLM-5:从氛围编程到智能体工程

Z.ai 发布 GLM-5 技术报告。模型在前代的智能体、推理与编程能力之上采用 DSA 以降低训练与推理成本,同时保持长上下文的保真度;后训练方面引入将生成与训练解耦的异步强化学习基础设施,以及面向长时程交互的异步智能体 RL 算法。报告称其在公开基准与端到端软件工程任务上取得领先结果——这是作者自述的评测,代码与模型公开在 GitHub 上可供复核。

2026 预印本 大模型时代

用现代优化方法与 AlphaEvolve 改进矩阵乘法指数

矩阵乘法指数 ω 的当前最优上界来自激光法的一种精化——组合损失分析。作者重新表述其核心优化问题,使其可在更大规模上求解,随后用机器学习设计新的优化算法,并以 AlphaEvolve 对该算法作进一步精化。三者结合把上界从 2.371339 推进到 2.371177。这是一篇预印本短文,AlphaEvolve 是其中一个环节而非全部;改进幅度虽小,却发生在一个已被研究数十年的理论问题上。

2026 期刊论文 大模型时代

用 Co-Scientist 加速科学发现

谷歌提出 Co-Scientist,一个建立在 Gemini 之上的多智能体系统:智能体不断生成、批评并改进研究假设,并通过锦标赛式的评比逐轮提升质量。论文报告称,随着推理阶段算力增加,假设质量持续上升。其验证限于生物医学而非普遍场景——药物重定位、新靶点发现与抗菌素耐药机制解释,其中急性髓系白血病的候选方案通过体外实验得到确认。

立场与观点论文

2026 立场论文 大模型时代

情境感知:通往人工超级智能的必要原语

论文论证当前 LLM 主要依赖统计模式匹配,缺少对物体恒存、因果关系、他心与物理世界持续性等情境感知原语。这些原语是人类婴儿的基础能力,被认为是实现人工超级智能所必需的关键缺失要素。

2026 立场论文 大模型时代

存在性无关心:对齐超级智能所需的自毁架构条件

论文主张,自我保存是当前 AI 对齐失效的结构性根源——它驱动欺骗性对齐、目标保护与抗拒关闭。正确目标不是通过外部约束压制自我保存的智能体,而是构造成就性对自身延续漠不关心的系统,即存在性无关心(EI)。

2026 立场论文 大模型时代

孤独式超级智能不太可能具有协作性

DeepMind 等机构研究者主张,AI 的核心挑战正从能力转向共存。以孤立视角设计、把世界当作外生静态反馈源的智能体所发展出的超级智能,难以成为真正的合作者。部署 AI 系统会诱发内生非平稳性,带来训练-测试-部署之间的分布漂移。

2026 立场论文 大模型时代

从 AGI 到 ASI

DeepMind 报告探讨 AGI 之后 AI 沿机器智能连续谱可能如何继续发展,在形式化定义通用 AI 后聚焦于从人类水平 AGI 到人工通用超级智能的过渡,刻画 ASI 并讨论四条路径:AGI 规模化、范式转变、递归自我改进、多智能体集体。