1931 artikel jurnal Teori Awal
Gödel, K. · Monatshefte für Mathematik und Physik 38(1): 173–198
Membuktikan bahwa setiap sistem formal konsisten yang mampu mengungkapkan aritmetika memuat pernyataan benar yang tidak dapat dibuktikannya, menetapkan batas yang kelak membingkai apa yang dapat diselesaikan komputasi dan penalaran mesin.
1936 artikel jurnal Teori Awal
Turing, A. M. · Proceedings of the London Mathematical Society s2-42(1): 230–265
Memperkenalkan mesin Turing universal dan membuktikan bahwa Entscheidungsproblem tidak terputuskan, meletakkan dasar teoretis ilmu komputer.
1936 artikel jurnal Teori Awal
Church, A. · American Journal of Mathematics 58(2): 345
Mendefinisikan keterhitungan efektif melalui kalkulus λ dan menunjukkan satu persoalan yang tak dapat diputuskan prosedur semacam itu, mencapai batas komputasi secara terpisah dari Turing.
1943 artikel jurnal Teori Awal
McCulloch, W. S. & Pitts, W. · Bulletin of Mathematical Biophysics 5(4): 115–133
Memodelkan aktivitas saraf sebagai logika proposisional, menyajikan teori matematis pertama tentang jaringan saraf tiruan.
1948 artikel jurnal Teori Awal
Shannon, C. E. · Bell System Technical Journal 27(3): 379–423; 27(4): 623–656
Makalah pendiri teori informasi, yang mendefinisikan entropi dan kapasitas kanal sebagai batas mendasar komunikasi.
1950 artikel jurnal Teori Awal
Turing, A. M. · Mind LIX(236): 433–460
Mengusulkan permainan peniruan (uji Turing) dan merumuskan secara sistematis pertanyaan “Dapatkah mesin berpikir?”, yang turut menegakkan AI sebagai program penelitian.
1955 artikel jurnal Teori Awal
McCarthy, J., Minsky, M. L., Rochester, N. & Shannon, C. E. · Dartmouth College, 1955; republished in AI Magazine 27(4): 12–14 (2006)
Proposal pendirian lokakarya musim panas Dartmouth memperkenalkan istilah “kecerdasan buatan” dan menggariskan agenda penelitian bidang ini.
1956 artikel jurnal Lahirnya AI
Newell, A. & Simon, H. A. · IRE Transactions on Information Theory IT-2(3): 61–79
Memaparkan Logic Theorist, program pertama yang membuktikan teorema matematis, yang menunjukkan penalaran otomatis dalam logika proposisional.
1958 artikel jurnal Lahirnya AI
Newell, A., Shaw, J. C., Simon, H. A. · Psychological Review 65(3): 151–166
Memandang pemecahan masalah manusia sebagai pencarian heuristik dalam ruang keadaan simbolis, pemaparan yang melandasi General Problem Solver dan pandangan pemrosesan-informasi tentang pikiran.
1958 artikel jurnal Lahirnya AI
Rosenblatt, F. · Psychological Review 65(6): 386–408
Memperkenalkan neuron ambang linear terlatih yang pertama, menurunkan garis keturunan koneksionis yang bermuara pada pembelajaran mendalam modern.
1958 makalah konferensi Lahirnya AI
McCarthy, J. · Proceedings of the Symposium on Mechanisation of Thought Processes (NPL Teddington), 75–91. London: HMSO
Mengusulkan Advice Taker, program yang bernalar dengan aksioma deklaratif dan menerima “nasihat” baru berupa kalimat bahasa Inggris, yang turut menegakkan agenda penelitian representasi pengetahuan dan AI simbolis.
1959 artikel jurnal Lahirnya AI
Samuel, A. L. · IBM Journal of Research and Development 3(3): 210–229
Memperagakan pembelajaran lewat permainan melawan diri sendiri dengan fungsi penilaian pada program dam, sebuah tonggak awal pembelajaran penguatan yang dikaitkan dengan istilah “pembelajaran mesin”.
1959 artikel jurnal Lahirnya AI
Gelernter, H. · Information and Control 2(1): 80–89
Gelernter membahas bagaimana mesin dapat memanipulasi secara efisien sistem formal yang predikatnya sangat simetris, dan mengajukan sebuah teorema serta kaidah simetri sintaktis sebagai jawabannya. Karya ini berjalan berdampingan dengan mesin teorema geometri yang ia bangun di IBM, yang membuktikan teorema pertamanya dalam geometri bidang Euklides dasar pada awal musim semi 1959.
1960 makalah konferensi Lahirnya AI
Widrow, B., Hoff, M. E. · IRE WESCON Convention Record, Part 4, 96–104
Memperkenalkan neuron ADALINE dan kaidah pembelajaran Least-Mean-Squares (LMS), pendahulu penurunan gradien stokastik modern.
1960 artikel jurnal Lahirnya AI
McCarthy, J. · Communications of the ACM 3(4): 184–195
Memperkenalkan ekspresi simbolis, fungsi rekursif atasnya, dan eval yang memungkinkan sebuah bahasa menafsirkan dirinya sendiri — rancangan yang menjadi Lisp dan bahasa kerja AI simbolis.
1961 laporan teknis Lahirnya AI
Rosenblatt, F. · Cornell Aeronautical Laboratory technical report (DTIC AD0256582)
Menghimpun kerja perseptron menjadi teori utuh tentang jaringan probabilistik berlapis, menyatakan sekaligus apa yang dapat dipelajari mesin semacam itu dan di mana bentuk satu lapisnya berhenti.
1966 artikel jurnal Lahirnya AI
Weizenbaum, J. · Communications of the ACM 9(1): 36–45
Membangun program yang tampak mampu bercakap-cakap dari pencocokan pola dan kaidah penulisan ulang, dan penulisnya seketika menunjukkan betapa banyak pemahaman yang dilekatkan pembaca padanya padahal tidak dimilikinya.
1982 artikel jurnal Musim Dingin AI
Hopfield, J. J. · Proceedings of the National Academy of Sciences 79(8): 2554–2558
Memperkenalkan jaringan memori asosiatif Hopfield, menghubungkan komputasi saraf dengan lanskap energi dalam fisika statistik dan menghidupkan kembali minat pada jaringan saraf di awal musim dingin AI.
1982 artikel jurnal Musim Dingin AI
McDermott, J. · Artificial Intelligence 19(1): 39–88
Mendokumentasikan sistem kaidah produksi yang setiap hari mengonfigurasi pesanan komputer DEC, salah satu dari sedikit sistem pakar yang bertahan dalam penggunaan produksi rutin dan dapat dihitung nilai ekonominya.
1986 artikel jurnal Musim Dingin AI
Pearl, J. · Artificial Intelligence 29(3): 241–288
Meletakkan dasar algoritmis jaringan keyakinan Bayes, termasuk penyampaian pesan pada graf berstruktur pohon serta perkakas moralisasi/triangulasi yang menggerakkan inferensi probabilistik dan penalaran kausal modern.
1986 artikel jurnal Musim Dingin AI
Rumelhart, D. E., Hinton, G. E., Williams, R. J. · Nature 323(6088): 533–536
Rumusan kanonis algoritme perambatan balik untuk jaringan saraf berlapis banyak, yang menunjukkan bahwa unit tersembunyi dapat mempelajari representasi internal yang berguna dan menyalakan kembali penelitian koneksionis pada akhir 1980-an.
1988 artikel jurnal Musim Dingin AI
Sutton, R. S. · Machine Learning 3(1): 9–44
Memformalkan keluarga pembelajaran beda temporal (TD), menyatukan program dam Samuel dengan penguatan sekunder dari psikologi hewan dan meletakkan landasan algoritmis bagi TD(λ), Q-learning, serta metode gradien kebijakan modern.
1990 artikel jurnal Musim Dingin AI
Elman, J. L. · Cognitive Science 14(2): 179–211
Memperkenalkan Simple Recurrent Network (jaringan Elman) dan menunjukkan bahwa struktur dinamis berdimensi rendah dapat muncul dari pelatihan atas masukan berurutan, salah satu peragaan paling awal pembelajaran representasi yang berguna pada jaringan rekuren.
1995 artikel jurnal Kebangkitan
Cortes, C., Vapnik, V. · Machine Learning 20(3): 273–297
Memperkenalkan mesin vektor dukung bermargin lunak, menambahkan variabel kendur untuk menangani data yang tak terpisahkan dan mengubah pengklasifikasi margin-maksimal menjadi metode pembelajaran serbaguna yang dominan pada akhir 1990-an.
1997 artikel jurnal Kebangkitan
Hochreiter, S., Schmidhuber, J. · Neural Computation 9(8): 1735–1780
Memperkenalkan arsitektur LSTM awal yang memakai sel memori, gerbang masukan, dan gerbang keluaran untuk menjaga aliran galat sepanjang barisan yang panjang; gerbang lupa yang kini baku diperkenalkan kemudian oleh Gers, Schmidhuber, dan Cummins.
1998 artikel jurnal Kebangkitan
LeCun, Y., Bottou, L., Bengio, Y., Haffner, P. · Proceedings of the IEEE 86(11): 2278–2324
Menyajikan jaringan saraf konvolusional LeNet-5 dan alur pembelajaran berbasis gradien ujung-ke-ujung yang utuh — mencakup lapisan rugi, perambatan balik melintasi konvolusi dan penggabungan, serta deskripsi jaringan transformasi graf — yang menjadi cetak biru model penglihatan mendalam modern.
2006 artikel jurnal Kebangkitan
Geoffrey E. Hinton, Ruslan R. Salakhutdinov · Science 313(5786): 504–507
Memperkenalkan autoenkoder dalam yang merekonstruksi data berdimensi tinggi jauh lebih setia daripada PCA, memantik percikan pertama kebangkitan pembelajaran mendalam.
2006 artikel jurnal Kebangkitan
Geoffrey E. Hinton, Simon Osindero, Yee-Whye Teh · Neural Computation 18(7): 1527–1554
Memperkenalkan contrastive divergence dan pralatih lapis demi lapis secara serakah, yang untuk pertama kalinya memungkinkan jaringan dalam dilatih secara efektif dan mengakhiri musim dingin panjang keraguan terhadap koneksionisme.
2009 makalah konferensi Kebangkitan
Raina, R., Madhavan, A., Ng, A. Y. · Proceedings of the 26th Annual International Conference on Machine Learning (ICML 2009): 873–880
Memindahkan pelatihan model nirselia dalam ke prosesor grafis dengan percepatan berorde magnitudo, menjadikan lazim jalur perangkat keras yang menopang penskalaan pembelajaran mendalam sedasawarsa berikutnya.
2013 makalah konferensi Kebangkitan
Volodymyr Mnih, Koray Kavukcuoglu, David Silver, Alex Graves, Ioannis Antonoglou, Daan Wierstra, Martin Riedmiller · NeurIPS 2013 Deep Learning Workshop (arXiv:1312.5602)
DQN memadukan Q-learning dengan jaringan konvolusional dalam dan mencapai permainan setara manusia pada gim Atari 2600 dari piksel mentah, membuka jalan bagi pembelajaran penguatan umum.
2013 makalah konferensi Kebangkitan
Tomas Mikolov, Kai Chen, Greg Corrado, Jeffrey Dean · ICLR 2013 Workshop (arXiv:1301.3781)
Model CBOW dan Skip-gram pada word2vec membuat pelatihan penyematan kata berskala besar menjadi murah dan secara termasyhur menyingkap geometri semantis seperti king - man + woman ≈ queen.
2013 makalah konferensi Kebangkitan
Diederik P. Kingma, Max Welling · ICLR 2014 (arXiv:1312.6114)
VAE menyatukan pemodelan generatif bervariabel laten dengan pelatihan gradien stokastik melalui kiat reparameterisasi, memberi pembelajaran mendalam generatif modern landasan matematisnya.
2014 makalah konferensi Kebangkitan
Dzmitry Bahdanau, Kyunghyun Cho, Yoshua Bengio · ICLR 2015 (arXiv:1409.0473)
Memperkenalkan atensi terpelajari ke dalam penerjemahan enkoder-dekoder, membebaskan kalimat panjang dari sempitan berpanjang tetap dan menyemai setiap Transformer sesudahnya.
2014 makalah konferensi Kebangkitan
Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio · NeurIPS 2014 (arXiv:1406.2661)
GAN membiarkan generator dan diskriminator berduel untuk mempelajari sebaran berdimensi tinggi secara implisit, membuka jalan besar kedua pemodelan generatif.
2014 artikel jurnal Kebangkitan
Nitish Srivastava, Geoffrey E. Hinton, Alex Krizhevsky, Ilya Sutskever, Ruslan Salakhutdinov · Journal of Machine Learning Research 15(56): 1929–1958
Dropout membungkam unit secara acak untuk memutus koadaptasi, meningkatkan generalisasi jaringan besar secara tajam dan menjadi perkakas baku dalam praktik pembelajaran mendalam.
2015 makalah konferensi Kebangkitan
Sergey Ioffe, Christian Szegedy · ICML 2015 (arXiv:1502.03167)
BatchNorm menormalkan masukan tiap lapis, memungkinkan jaringan dalam dilatih dengan laju belajar lebih tinggi dan menyatu lebih cepat; ia menjadi balok penyusun yang nyaris baku pada model penglihatan.
2015 pracetak Kebangkitan
Sohl-Dickstein, J., Weiss, E. A., Maheswaranathan, N., Ganguli, S. · arXiv:1503.03585
Memandang pemodelan generatif sebagai pembalikan proses pemberian derau bertahap, rumusan yang menjadi sandaran model difusi di kemudian hari.
2015 makalah konferensi Kebangkitan
Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun · CVPR 2016 (arXiv:1512.03385)
Sambungan residual menstabilkan pelatihan jaringan beratus dan beribu lapis; ResNet mencapai galat top-5 sebesar 3,57% pada ImageNet, model pertama yang melampaui ketepatan setara manusia dan mengatur ulang skala model penglihatan.
2016 artikel jurnal Kebangkitan
Sennrich, R., Haddow, B., Birch, A. · Proceedings of ACL 2016: 1715–1725 (arXiv:1508.07909)
Memecah kata menjadi satuan subkata yang diturunkan dari frekuensi sehingga kosakata berukuran tetap dapat mengeja apa saja, skema tokenisasi yang diwarisi sebagian besar model bahasa sesudahnya.
2016 makalah konferensi Kebangkitan
Han, S., Mao, H., Dally, W. J. · ICLR 2016 (arXiv:1510.00149)
Memadukan pemangkasan, kuantisasi terlatih, dan pengodean Huffman menjadi satu alur yang menyusutkan jaringan sebesar satu orde magnitudo dengan sedikit kehilangan ketepatan, pernyataan awal bahwa presisi numeris adalah variabel rancangan.
2016 makalah konferensi Kebangkitan
Aäron van den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalchbrenner, Andrew Senior, Koray Kavukcuoglu · NeurIPS 2016 (arXiv:1609.03499)
WaveNet memodelkan audio mentah sampel demi sampel dengan konvolusi kausal berdilatasi, mendorong sintesis wicara mendekati kealamian manusia dan membuka jalan bagi model audio saraf berikutnya.
2017 pracetak Kebangkitan
John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov · arXiv:1707.06347
PPO menggantikan perkakas trust-region dengan pengganti orde-pertama yang terpangkas, menjadikan metode gradien kebijakan sekaligus stabil dan efisien pada skala besar dan dengan cepat menjadi standar de facto RL terapan.
2017 pracetak Kebangkitan
Shazeer, N. et al. · arXiv:1701.06538
Menyalurkan setiap token hanya melalui beberapa pakar dari sekian banyak, sehingga jumlah parameter sebuah jaringan dapat tumbuh jauh melampaui komputasi yang dikeluarkan untuk satu masukan.
2017 makalah konferensi Kebangkitan
Vaswani et al. · NeurIPS 2017 (arXiv:1706.03762)
Memperkenalkan Transformer, arsitektur beratensi murni yang meninggalkan rekurensi dan konvolusi serta melampaui mutu transduksi barisan sebelumnya sembari berlatih dalam sepersekian waktu.
2018 artikel jurnal Kebangkitan
Kudo, T., Richardson, J. · EMNLP 2018, System Demonstrations: 66–71 (arXiv:1808.06226)
Melatih tokenizer subkata langsung dari teks mentah tanpa pratokenisasi khas bahasa tertentu, sehingga satu alur melayani bahasa yang tidak memisahkan kata dengan spasi.
2018 makalah konferensi Kebangkitan
Devlin et al. · NAACL 2019 (arXiv:1810.04805)
Melakukan pralatih Transformer dwiarah yang dalam dengan pemodelan bahasa bertopeng dan prediksi kalimat berikutnya, lalu menetapkan capaian terbaik baru pada sebelas tolok ukur NLP.
2019 artikel jurnal Kebangkitan
Raffel et al. · Journal of Machine Learning Research 21(140): 1–67 (arXiv:1910.10683)
Memandang setiap tugas NLP sebagai teks-ke-teks dan memakai korpus C4 untuk membandingkan secara sistematis pilihan rancangan pembelajaran alih pada satu Transformer terpadu.
2020 makalah konferensi Era LLM
Ho, Jain, Abbeel · NeurIPS 2020 (arXiv:2006.11239)
Memperkenalkan DDPM, yang menunjukkan bahwa model probabilistik difusi penderauan berulang menyetarai GAN dalam sintesis citra berkesetiaan tinggi.
2021 artikel jurnal Era LLM
Narayanan, D. et al. · SC 2021: 1–15 (arXiv:2104.04473)
Menyusun paralelisme tensor, pipa, dan data menjadi satu penjadwalan dan mengukur keluaran pelatihan sebuah model bahasa melintasi ribuan GPU.
2021 pracetak Era LLM
Hu, E. J. et al. · arXiv:2106.09685
Membekukan bobot terpralatih dan sebagai gantinya melatih sepasang matriks berperingkat rendah, memangkas biaya penyesuaian model besar menjadi sebagian kecil dari penalaan halus penuh.
2021 makalah konferensi Era LLM
Ramesh et al. · ICML 2021 (arXiv:2102.12092)
Memakai Transformer autoregresif atas token teks dan citra diskret untuk menghasilkan pembangkitan teks-ke-citra nircontoh bermutu tinggi (DALL·E).
2021 makalah konferensi Era LLM
Radford et al. · ICML 2021 (arXiv:2103.00020)
Melatih pembelajaran kontrastif citra-teks pada 400 juta pasangan untuk menghasilkan enkoder penglihatan yang beralih secara nircontoh ke banyak tugas hilir.
2021 pracetak Era LLM
Chen, M. et al. · arXiv:2107.03374
Menyajikan model GPT yang ditala halus pada kode berikut tolok ukur yang dinilai dari kebenaran fungsional, mengubah pemrograman dari sekadar ragam pembangkitan teks menjadi kemampuan yang terukur, sekaligus membahas dampak keselamatan dan ketenagakerjaannya.
2021 makalah konferensi Era LLM
Rombach et al. · CVPR 2022 (arXiv:2112.10752)
Menjalankan difusi dalam ruang laten autoenkoder terpralatih, memungkinkan sintesis teks-ke-citra beresolusi tinggi dengan komputasi yang sederhana (Stable Diffusion).
2022 makalah konferensi Era LLM
Wei et al. · NeurIPS 2022 (arXiv:2201.11903)
Menunjukkan bahwa memancing model bahasa besar dengan langkah penalaran antara meningkatkan kinerja secara berarti pada penalaran aritmetis, akal sehat, dan simbolis.
2022 makalah konferensi Era LLM
Ouyang et al. · NeurIPS 2022 (arXiv:2203.02155)
Menala halus GPT-3 dengan pembelajaran penguatan dari umpan balik manusia agar mengikuti instruksi secara lebih setia — pendahulu langsung ChatGPT (InstructGPT).
2022 laporan teknis Era LLM
Bai et al. · Anthropic Technical Report 2022 (arXiv:2212.08073)
Melatih asisten yang membantu sekaligus tidak membahayakan dengan RLAIF, tempat model mengkritik dan merevisi keluarannya sendiri terhadap sebuah konstitusi tertulis.
2023 laporan teknis Era LLM
Touvron et al. · Meta AI Technical Report 2023 (arXiv:2302.13971)
Melatih model fondasi berukuran 7–65 miliar parameter pada data yang tersedia untuk umum, memperagakan bahwa model terbuka dapat menyaingi model perbatasan tertutup dengan sebagian kecil komputasi.
2023 artikel jurnal Era LLM
Wang, L. et al. · Frontiers of Computer Science 18(6), 2024 (arXiv:2308.11432)
Menata kerja agen yang tersebar ke dalam pembangunan, evaluasi, dan penerapan, menandai titik ketika istilah itu mengendap dari serangkaian praktik menjadi sebuah bidang.
2023 pracetak Era LLM
Dettmers, T. et al. · arXiv:2305.14314
Merambatkan balik melalui model dasar terkuantisasi 4 bit ke dalam adaptor berperingkat rendah, membawa penalaan halus model besar ke jangkauan satu GPU tunggal.
2023 makalah konferensi Era LLM
Frantar, E., Ashkboos, S., Hoefler, T., Alistarh, D. · ICLR 2023 (arXiv:2210.17323)
Mengkuantisasi bobot model bahasa besar setelah pelatihan, selapis demi selapis dan dalam satu kali jalan, sehingga model dapat disajikan pada presisi lebih rendah tanpa pelatihan ulang.
2023 makalah konferensi Era LLM
Leviathan, Y., Kalman, M., Matias, Y. · ICML 2023 (arXiv:2211.17192)
Meminta model draf kecil mengusulkan beberapa token yang diverifikasi model sasaran secara paralel, memangkas latensi tanpa mengubah sebaran keluarannya.
2023 artikel jurnal Era LLM
Kwon, W. et al. · SOSP 2023: 611–626 (arXiv:2309.06180)
Mengelola tembolok atensi dalam laman berukuran tetap sebagaimana sistem operasi mengelola memori, sehingga sebuah peladen menampung jauh lebih banyak permintaan serentak tanpa mencadangkan kasus terburuk bagi masing-masing.
2023 pracetak Era LLM
Gu, A. and Dao, T. · arXiv:2312.00752
Memperkenalkan Mamba, arsitektur model ruang-keadaan selektif yang menyetarai atau melampaui atensi Transformer pada bahasa dan moda lain dengan kompleksitas waktu linear — arsitektur pasca-Transformer paling berpengaruh pada 2023.