論可計算數及其在判定問題上的應用
圖靈提出通用圖靈機模型,並證明判定問題不可解,為計算機科學奠定理論基礎。
從1936年至今,依出版狀態與編輯分區呈現 73 項代表性工作
論文是 AI 歷史最硬的骨架。這裡收錄了塑造人工智慧學科的 73 篇奠基性論文,每篇配有可直接存取的原文連結。
選錄依據包括歷史代表性、技術影響與編輯判斷;目錄同時收錄同儕審查論文、技術報告、預印本、立場論文與系統卡,並明確標示出版狀態。歡迎透過「編輯說明與更正」頁面的公開管道提交更正或新增建議。
顯示 73 篇 / 共 73 篇論文
圖靈提出通用圖靈機模型,並證明判定問題不可解,為計算機科學奠定理論基礎。
以命題邏輯模型化神經活動,提出人工神經網路的第一個數學理論。
定義資訊熵與通道容量,創立資訊理論,並為日後 AI 的機率方法奠定基礎。
提出模仿遊戲(圖靈測試)作為機器智慧的操作性定義,為往後七十年的 AI 提問定下框架。
首次創造「人工智慧」一詞並提出對應的研究議程,使 AI 正式成為一門學科。
實作第一個啟發式推理程式,證明機器能模仿人類的問題解決策略,並引入「複雜資訊處理系統」的概念。
提出首個可訓練的線性閾值神經元,開啟最終通向現代深度學習的連接主義脈絡。
提出「advice taker」概念,讓程式能從形式化的常識知識庫中得出結論,為知識表徵與推理奠下概念基礎。
展示一個能透過自我對弈持續進步的西洋跳棋程式,開創機器學習與 alpha-beta 自我改進的研究。
針對謂詞具有高度對稱性的形式系統,如何讓機器高效處理的問題,Gelernter 給出了一條語法對稱性定理與相應規則。這項工作與他同期在 IBM 建造的幾何定理機相伴——那台機器在1959年初春證明了它的第一條歐氏平面幾何定理。
提出 LMS 規則(Adaline),這是第一個被廣泛使用的、用於自適應線性網路的梯度下降學習法則。
提出 Hopfield 聯想記憶網路,將神經計算與統計物理的能量景觀連結,在 AI 寒冬初期重新燃起學界對神經網路的興趣。
系統化信念網路上的融合、傳播與結構化運算,為貝氏網路推斷提供演算法基礎。
推廣以反向傳播演算法訓練多層神經網路,讓實用的深度學習成為可能。
系統化時序差分(TD)學習方法,使其成為現代強化學習的核心演算法之一。
提出 Elman 簡易循環網路,證明神經網路能學會時序結構,為後續序列模型鋪路。
提出軟間隔支援向量機,這種最大邊距分類器成為1990年代機器學習最具代表性的方法。
提出最初的 LSTM 架構,以記憶單元、輸入閘與輸出閘改善長序列的誤差信號傳遞;今日常見的遺忘閘由 Gers、Schmidhuber 與 Cummins 在後續研究中引入。
提出 LeNet-5,這個經典的卷積神經網路達到可實用品質的手寫數字辨識,並奠定 CNN 的基本架構。
提出深度自編碼器,以遠勝於 PCA 的方式重建高維資料,為深度學習復興點燃第一道火花。
提出以貪婪逐層演算法訓練的深度信念網路,首次證明深層模型能被有效訓練。
將 Q 學習與卷積網路結合,使 Atari 遊戲能從原始像素達到人類等級表現,開創深度強化學習。
提出 skip-gram 與 CBOW 架構以產生稠密詞嵌入,開啟預訓練詞向量的時代。
提出變分自編碼器,將變分推斷與深度生成模型結合,成為第一個被廣泛採用的深度潛變數模型。
為神經機器翻譯引入加性(Bahdanau)注意力機制,證明柔性對齊能讓解碼器聚焦於相關的來源詞元,並直接啟發了 Transformer。
將生成模型建構成生成器與判別器之間的雙人極小極大賽局,開啟一整個隱式生成模型家族。
提出 Dropout,一個簡單的隨機正則化技術,成為深度學習訓練流程中的預設方法。
提出批次正規化,對小批量內的層輸入進行正規化以穩定訓練並大幅加速深度網路收斂。
提出殘差連線,使數百層深的網路能被有效訓練,並以大幅差距贏得 ImageNet 2015 競賽。
提出以擴張式因果卷積的自迴歸模型直接生成原始音訊波形,大幅提升文字轉語音的自然度。
提出 PPO,一個簡單且穩定的一階策略梯度法,成為現代強化學習中的預設策略最佳化演算法。
提出 Transformer,一個完全基於注意力的架構,捨棄循環與卷積,以更短訓練時間超越當時最佳的序列轉換模型品質。
提出以遮罩語言建模與下一句預測預訓練的雙向 Transformer,在多項 NLP 基準上刷新當時最佳成績。
將所有 NLP 任務統一為文本到文本的形式,系統性地消融各種遷移學習選擇,為大規模預訓練模型建立標準配方。
將擴散過程重新表述為去噪變分訓練目標,使影像生成品質重回最先進水準,並開啟擴散模型時代。
展示 12B 參數的自迴歸 Transformer 能直接從文字標題生成多樣且高保真的影像,點燃文本到影像的研究熱潮。
在網路規模的影像-文字配對資料上訓練影像編碼器,達到強勁的零樣本影像分類能力,並為日後許多多模態系統提供視覺塔。
將擴散過程移至感知潛空間,使高解析度文本到影像生成能在消費級 GPU 上執行,並讓影像合成的門檻大幅降低。
顯示讓語言模型產生中間推理步驟的提示方式,能顯著提升其在算術、常識與符號推理基準上的表現。
大規模應用基於人類回饋的強化學習(RLHF),使 GPT-3 輸出更貼近人類意圖,並奠定 RLHF 作為對齊標準配方的地位。
提出 RLAIF,讓模型依據一份書面「憲法」對自身輸出進行批評與修正,以降低對齊時對人類有害性標註的依賴。
釋出 LLaMA 系列開源基礎模型,證明規模相對較小但訓練精良的模型能與大上許多的閉源模型匹敵,加速開源權重運動。
提出基於選擇性狀態空間的 Mamba 架構,在語言等模態上以線性時間複雜度匹配或超越 Transformer 注意力,是2023年最具影響力的非 Transformer 架構之一。
以 GPU 訓練的 CNN 大幅勝出2012年 ImageNet 競賽,標誌著深度學習超越傳統電腦視覺的轉折點。
發表 Nature 版的 DQN,證明深度強化學習能在廣泛的 Atari 遊戲上達到人類等級表現,讓深度 RL 進入主流視野。
結合深度策略/價值網路與蒙地卡羅樹搜尋擊敗頂尖人類圍棋冠軍,成為強化學習史上具里程碑意義的時刻。
證明在未標記文字上預訓練的生成式 Transformer,可微調至多種 NLP 任務的強勁表現,開創 GPT 路線。
展示 1.5B 參數的 Transformer 語言模型能展現零樣本多任務行為,推動「語言模型即多任務學習者」的討論。
證明 175B 參數的 Transformer 能僅藉由情境學習達到強勁少樣本表現,使提示工程成為主流研究範式。
記錄 GPT-4 這個大規模多模態模型在廣泛的專業與學術基準上達成或超越人類等級表現。
推出原生多模態的 Gemini 模型家族,在推理、程式設計與多模態基準上樹立新一波最佳成績。
OpenAI 發布 o1 系列系統卡,介紹透過大規模強化學習訓練模型使用思維鏈推理。o1 在科學與程式設計任務上達到當時 SOTA,並展示基於推理的策略遵循能力。
ARC Prize 推出 ARC-AGI-3——一個用於評估智慧體智慧的互動式基準,要求智慧體在抽象的回合制環境中探索、推斷目標、建構環境動力學的內部模型並規劃行動序列。截至2026年3月,人類可解決 100% 的環境,而前沿 AI 系統得分低於 1%。
將稀疏自編碼器應用於前沿 LLM,萃取數百萬個單語意特徵,證明機制可解釋性能擴展至生產規模的模型。
釋出 DeepSeek-V3,一個 671B 參數的開源 MoE 模型,以極低的訓練成本在多項主要基準上逼近前沿閉源模型。
推出 Gemini 1.5 系列,將上下文視窗擴展到百萬級 token 並保持多模態能力,能在多部長文檔與數小時音視訊間進行細粒度推理。
Meta 發布 Llama 3 系列開放權重大模型,原生支援多語言、程式設計、推理與工具使用。最大 405B dense Transformer 是當時最大的開放權重模型之一。
Meta 發布 SAM 2——首個面向影像與影片統一的可提示分割基礎模型,並建構了迄今最大的影片分割資料集。
Google DeepMind 發布 Gemma 2 輕量級開源模型系列(2B-27B),在 Transformer 上應用多種已知架構改進,引入滑動視窗注意力等技巧,在多項基準上接近更大模型。
DeepSeek 發布 R1——首個透過大規模強化學習激發強推理能力的開源模型,在數學與程式設計任務上比肩 OpenAI o1 等閉源推理模型,並以 MIT 協議開放全部權重。
作者在 1,000 道精選推理題上微調 Qwen2.5-32B,並引入預算強制,用以限制或延長模型在推理階段的思考時長。結果在競賽數學上超過 o1-preview,隨測試時算力增加,AIME24 成績從 50% 升至 57%。這直接反駁了能力只能來自更大規模訓練的假設。
Qwen3 是一個統一的模型家族,參數量從 6 億到 2350 億,包含稠密與專家混合兩種架構,並可在思考與非思考模式之間切換,使推理深度成為請求層面的選擇。多語言支援從 29 種擴展到 119 種,權重以 Apache 2.0 授權發布。
AlphaEvolve 是一個演化式程式設計智慧體:它調度一條由大模型組成的自主流水線,直接改寫演算法程式碼,並不斷從一個或多個評估器取得回饋以迭代改進。在 Google 內部,它改進了資料中心排程演算法、在硬體加速器電路設計中找到等價簡化,並加速了支撐它自身的模型訓練。數學與電腦科學方面,它發現了可被證明正確的新演算法,其中一項用 48 次純量乘法完成兩個 4×4 複數矩陣相乘——在這一設定下,這是56年來對 Strassen 演算法的首次改進。
Ai2 發布 7B、13B 與 32B 三種規模的 OLMo 2,並公開全部產物:權重、完整訓練資料、訓練程式碼與配方、訓練紀錄,以及數千個中間檢查點。報告說明了提升訓練穩定性與單 token 效率的改動,介紹了用於後期課程訓練的資料混合 Dolmino Mix 1124,並在最後階段引入可驗證獎勵的強化學習(RLVR)。其基座模型處於效能與訓練算力的帕累托前沿,在揭露訓練資料、程式碼與配方的同時,常能匹敵只發布權重的模型家族。
Olmo 3 將完全開放的模型家族擴展到 7B 與 32B,面向長脈絡推理、函式呼叫、程式設計、指令遵循、日常對話與知識回想建構。此次發布公開的是整條「模型流程」——建構過程中的每一個階段、檢查點、資料點與相依項,而不只是權重。Ai2 稱旗艦的 Olmo 3 Think 32B 是截至發布時最強的完全開放思考模型;這是在「完全開放」這一類別內的比較,並非與整體前沿系統的排名。
本文主張,集成外顯記憶是從 LLM 邁向 AGI 的基石。LLM 的底層學習機制高度類似於人類的內隱記憶,但 AGI 所必需的長期規劃、後設認知等高階認知功能依賴外顯記憶。
Z.ai 發布 GLM-5 技術報告。模型在前代的智能體、推理與程式設計能力之上採用 DSA 以降低訓練與推論成本,同時維持長脈絡的保真度;後訓練方面引入將生成與訓練解耦的非同步強化學習基礎設施,以及面向長時程互動的非同步智能體 RL 演算法。報告稱其在公開基準與端到端軟體工程任務上取得領先結果——這是作者自述的評測,程式碼與模型公開於 GitHub 可供複核。
矩陣乘法指數 ω 的當前最佳上界來自雷射法的一種精化——組合損失分析。作者重新表述其核心最佳化問題,使其可在更大規模上求解,隨後用機器學習設計新的最佳化演算法,並以 AlphaEvolve 對該演算法作進一步精化。三者結合把上界從 2.371339 推進到 2.371177。這是一篇預印本短文,AlphaEvolve 是其中一個環節而非全部;改進幅度雖小,卻發生在一個已被研究數十年的理論問題上。
Google 提出 Co-Scientist,一個建立在 Gemini 之上的多智能體系統:智能體不斷生成、批評並改進研究假說,並透過錦標賽式的評比逐輪提升品質。論文指出,隨著推論階段算力增加,假說品質持續上升。其驗證限於生物醫學而非普遍場景——藥物再定位、新標的發現與抗生素抗藥性機制解釋,其中急性骨髓性白血病的候選方案經體外實驗確認。
論文論證當前 LLM 主要依賴統計模式匹配,缺少對物體恆存、因果關係、他心與物理世界持續性等「情境感知」原語。這些原語是人類嬰兒的基礎能力,被認為是實現人工超級智能所必需的關鍵缺失要素。
論文主張,自我保存是當前 AI 對齊失效的結構性根源——它驅動欺騙性對齊、目標保護與抗拒關閉。目標不是透過外部約束壓制自我保存的智能體,而是建構成就性「對自身延續漠不關心」的系統,即「存在性無關心」(EI)。
DeepMind 等機構研究者主張,AI 的核心挑戰正從能力轉向共存。以孤立視角設計、把世界當作外生靜態回饋源的智慧體所發展出的超級智慧,難以成為真正的合作者。部署 AI 系統會誘發內生非平穩性,帶來訓練-測試-部署之間的分布漂移。
DeepMind 報告探討 AGI 之後 AI 沿機器智能連續譜可能如何繼續發展,在形式化定義通用 AI 後聚焦於「從人類水平 AGI 到人工通用超級智慧」的過渡,刻畫 ASI 並討論四條路徑:AGI 規模化、典範轉移、遞迴自我改進、多智慧體集體。