ยุคฟื้นตัว
ทศวรรษ 1990–ทศวรรษ 2010 · การเกิดขึ้นของการเรียนรู้เชิงลึก
ในช่วงกลางทศวรรษ 1990 เมื่อพลังการคำนวณดีขึ้นและอินเทอร์เน็ตแพร่หลาย การเรียนรู้ของเครื่อง โดยเฉพาะการเรียนรู้เชิงลึก เริ่มปรากฏตัว ช่วงเวลานี้ของการพัฒนา AI สามารถอธิบายได้ว่าเป็น “การปฏิวัติทางสถิติ”—การเปลี่ยนจากระบบที่ใช้กฎเป็นแบบจำลองเชิงความน่าจะเป็นและขับเคลื่อนด้วยข้อมูล
ในปี 2012 การเรียนรู้เชิงลึกชนะการแข่งขัน ImageNet อย่างถล่มทลาย ถือเป็นจุดเริ่มต้นของการปฏิวัติการเรียนรู้เชิงลึก ตั้งแต่นั้นมา AI ทำลายสถิติอย่างไม่เคยมีมาก่อนในการรู้จำภาพ การรู้จำเสียง และการประมวลผลภาษาธรรมชาติ ในปี 2016 ชัยชนะของ AlphaGo เหนือ Lee Sedol ได้นำ AI สู่จิตสำนึกของสาธารณชน เปิดฉากยุคใหม่ของปัญญาประดิษฐ์
ยุคนี้มีลักษณะเฉพาะคือการผสมผสานระหว่างข้อมูลขนาดใหญ่ ทรัพยากรการคำนวณที่ทรงพลัง และอัลกอริทึมการเรียนรู้เชิงลึก การแพร่หลายของอินเทอร์เน็ตทำให้สามารถรวบรวมข้อมูลปริมาณมหาศาล ขณะที่การพัฒนา GPU ให้รากฐานการคำนวณสำหรับการฝึกโครงข่ายประสาทเทียมขนาดใหญ่
เหตุการณ์สำคัญ
การเพิ่มขึ้นของวิธีการทางสถิติ
ในทศวรรษ 1990 วิธีการทางสถิติเริ่มครอบงำการวิจัย AI Hidden Markov Models (HMMs) ในการรู้จำเสียง Naive Bayes และต้นไม้ตัดสินใจในการเรียนรู้ของเครื่อง ล้วนประสบความสำเร็จอย่างดี
กำเนิดเวิลด์ไวด์เว็บ
Tim Berners-Lee สร้างเวิลด์ไวด์เว็บ การแพร่หลายของอินเทอร์เน็ตเปลี่ยนวิถีชีวิตของมนุษย์และให้ทรัพยากรข้อมูลที่ไม่เคยมีมาก่อนแก่ AI
Support Vector Machine
Vladimir Vapnik และคณะ เสนอ Support Vector Machine (SVM) ซึ่งเป็นวิธีการจำแนกและถดถอยอันทรงพลัง SVM ทำผลงานได้ดีเยี่ยมในการจำแนกข้อความและการรู้จำลายมือ
Vladimir Vapnik
Long Short-Term Memory (LSTM)
Sepp Hochreiter และ Jürgen Schmidhuber เสนอ LSTM ซึ่งเป็น RNN ชนิดพิเศษที่สามารถเรียนรู้การพึ่งพาระยะยาว LSTM ประสบความสำเร็จอย่างมากในการรู้จำเสียงและการสร้างแบบจำลองภาษา
Sepp Hochreiter & Jürgen Schmidhuber
LeNet-5
Yann LeCun พัฒนา LeNet-5 ซึ่งเป็น CNN สำหรับการรู้จำตัวเลขลายมือ LeNet-5 เป็นหนึ่งในแบบจำลองการเรียนรู้เชิงลึกแรก ๆ ที่ถูกนำไปใช้งานเชิงพาณิชย์ในวงกว้าง ใช้ในบริการไปรษณีย์สหรัฐฯ สำหรับการรู้จำรหัสไปรษณีย์
Yann LeCun
แบบจำลองภาษาเชิงความน่าจะเป็นด้วยโครงข่ายประสาท
Yoshua Bengio, Réjean Ducharme, Pascal Vincent และ Christian Jauvin เสนอแบบจำลองภาษาเชิงความน่าจะเป็นที่เรียนรู้ทั้งการแทนคำแบบกระจายและความน่าจะเป็นของลำดับคำร่วมกันเพื่อลดปัญหามิติสูง โมเดลนี้เป็นโครงข่ายแบบ feed-forward ไม่ใช่ RNN
Yoshua Bengio
โครงการคำนวณด้วยโครงข่ายประสาทของ CIFAR
ตั้งแต่ปี 2004 โครงการของ CIFAR สนับสนุนการแลกเปลี่ยนอย่างสม่ำเสมอระหว่าง Geoffrey Hinton, Yann LeCun, Yoshua Bengio และผู้ร่วมงาน โครงการช่วยประสานงานวิจัยที่มีส่วนต่อการฟื้นตัวของ deep learning แต่ไม่ใช่จุดเริ่มต้นสากลเพียงจุดเดียว
Geoffrey Hinton
Deep Belief Networks
Geoffrey Hinton เสนอ Deep Belief Networks (DBN) ซึ่งเป็นโครงข่ายประสาทเทียมแบบลึกแรกที่ฝึกสำเร็จ Hinton นำเสนอ “การฝึกก่อนทีละชั้น” เพื่อแก้ปัญหาการฝึก
Geoffrey Hinton
GPU สำหรับการเรียนรู้เชิงลึก
นักวิจัยเริ่มใช้ GPU เพื่อเร่งการฝึกการเรียนรู้เชิงลึก การคำนวณแบบขนานของ GPU ทำให้การฝึกโครงข่ายประสาทเทียมขนาดใหญ่เป็นไปได้
ชุดข้อมูล ImageNet
ทีม ImageNet เผยแพร่บทความฐานข้อมูลภาพแบบลำดับชั้นขนาดใหญ่ในปี 2009 โดยใช้ลำดับชั้น WordNet จัดระเบียบภาพที่มีป้ายกำกับ ต่อมา ImageNet และการแข่งขันการรู้จำกลายเป็นโครงสร้างพื้นฐานสำคัญของการฝึกและประเมินผลคอมพิวเตอร์วิทัศน์ขนาดใหญ่
Fei-Fei Li
ความก้าวหน้าด้านการรู้จำเสียง
Google ใช้แบบจำลองการเรียนรู้เชิงลึกเพื่อลดอัตราความผิดพลาดของการรู้จำเสียงลง 25% นี่เป็นความก้าวหน้าครั้งสำคัญครั้งแรกของการเรียนรู้เชิงลึกในการรู้จำเสียง
ความก้าวหน้าของ ImageNet
ทีมของ Alex Krizhevsky, Ilya Sutskever และ Geoffrey Hinton ใช้ AlexNet ในการแข่งขัน ImageNet และชนะอย่างถล่มทลาย อัตราความผิดพลาดลดลงจาก 26% เหลือ 15%
ทีม AlexNet
Word2Vec
Tomas Mikolov เผยแพร่ Word2Vec ซึ่งเป็นแบบจำลองโครงข่ายประสาทเทียมสำหรับการเรียนรู้การแทนความหมายของคำ Word2Vec ทำให้คอมพิวเตอร์สามารถเข้าใจความสัมพันธ์เชิงความหมายระหว่างคำได้
Tomas Mikolov
Generative Adversarial Networks (GAN)
Ian Goodfellow เสนอ GAN ซึ่งเป็นหนึ่งในนวัตกรรมที่สำคัญที่สุดในการเรียนรู้เชิงลึก GAN สร้างภาพที่สมจริงอย่างยิ่งผ่านการฝึกแบบปฏิปักษ์
Ian Goodfellow
ResNet
Kaiming He และคณะ เสนอ ResNet ซึ่งแก้ปัญหาความยากในการฝึกโครงข่ายเชิงลึกด้วยการเชื่อมต่อข้ามชั้น ResNet ทำให้สามารถฝึกโครงข่ายหลายร้อยชั้นได้
Kaiming He
AlphaGo เอาชนะ Lee Sedol
AlphaGo ของ DeepMind เอาชนะ Lee Sedol แชมป์โกะโลกด้วยคะแนน 4-1 โกะถือเป็นหนึ่งในเกมกระดานที่ยากที่สุดสำหรับ AI
DeepMind AlphaGo
สถาปัตยกรรม Transformer
Google เสนอสถาปัตยกรรม Transformer ซึ่งเป็นความก้าวหน้าที่ปฏิวัติวงการ NLP Transformer เป็นรากฐานของแบบจำลองภาษาขนาดใหญ่สมัยใหม่
Google Brain
บุคคลสำคัญ
Geoffrey Hinton
บิดาแห่งการเรียนรู้เชิงลึก
Hinton ร่วมกับ Yann LeCun และ Yoshua Bengio ได้รับรางวัล Turing ในปี 2018 ได้รับการขนานนามว่า “สามสหายแห่งการเรียนรู้เชิงลึก” ความมุ่งมั่นและนวัตกรรมของเขาได้เปลี่ยนโฉมหน้าของ AI อย่างสิ้นเชิง
Yann LeCun
บิดาแห่ง CNN
LeCun เป็นหัวหน้านักวิทยาศาสตร์ด้าน AI ที่ Facebook LeNet-5 ของเขาเป็นแบบจำลองการเรียนรู้เชิงลึกที่ประสบความสำเร็จเชิงพาณิชย์เป็นรายแรก ผลงานด้าน CNN ของเขาวางรากฐานสำหรับคอมพิวเตอร์วิทัศน์สมัยใหม่
Yoshua Bengio
ผู้บุกเบิกการเรียนรู้เชิงลึก
Bengio เป็นศาสตราจารย์ที่มหาวิทยาลัยมอนทรีออลและเป็นบุคคลสำคัญในการเรียนรู้เชิงลึก ผลงานด้าน RNN และ NLP ของเขาก็มีความสำคัญไม่แพ้กัน
Ian Goodfellow
บิดาแห่ง GAN
Goodfellow เสนอ GAN ในปี 2014 ซึ่งเป็นวิธีการปฏิวัติวงการ AI เชิงกำเนิด ตั้งแต่ดีปเฟกไปจนถึงการสร้างสรรค์ศิลปะ การประยุกต์ใช้ GAN มีอยู่ทุกหนทุกแห่ง
Fei-Fei Li
มารดาแห่ง ImageNet
Li เป็นศาสตราจารย์ที่มหาวิทยาลัย Stanford ชุดข้อมูล ImageNet ของเธอส่งผลกระทบอย่างลึกซึ้งต่อคอมพิวเตอร์วิทัศน์ เธอยังเป็นผู้ร่วมก่อตั้ง AI4ALL เพื่อส่งเสริมความหลากหลายในการศึกษา AI
คำกล่าวสำคัญ
การเรียนรู้เชิงลึกช่วยให้แบบจำลองการคำนวณที่ประกอบด้วยชั้นการประมวลผลหลายชั้นสามารถเรียนรู้การแทนข้อมูลที่มีหลายระดับของนามธรรม.
ถ้าปัญญาเป็นเค้ก การเรียนรู้แบบไม่มีผู้สอนจะเป็นเค้ก การเรียนรู้แบบมีผู้สอนจะเป็นน้ำตาลบนเค้ก และการเรียนรู้แบบเสริมกำลังจะเป็นเชอร์รี่บนเค้ก เรารู้วิธีทำน้ำตาลและเชอร์รี่ แต่เราไม่รู้วิธีทำเค้ก.
เป้าหมายของเราคือปัญญาประดิษฐ์ทั่วไป.