Thời kỳ Phục hưng
những năm 1990–những năm 2010 · Sự Trỗi dậy của Học Sâu
Giữa những năm 1990, với sự cải thiện sức mạnh tính toán và sự phổ biến của internet, học máy, đặc biệt là học sâu, bắt đầu trỗi dậy. Giai đoạn phát triển AI này có thể được mô tả là “cuộc cách mạng thống kê” — chuyển từ hệ thống dựa trên quy tắc sang các mô hình xác suất và dựa trên dữ liệu.
Năm 2012, học sâu giành chiến thắng áp đảo trong cuộc thi ImageNet, đánh dấu sự khởi đầu của cuộc cách mạng học sâu. Kể từ đó, AI đạt được những đột phá chưa từng có trong nhận dạng hình ảnh, nhận dạng giọng nói và xử lý ngôn ngữ tự nhiên. Năm 2016, chiến thắng của AlphaGo trước Lee Sedol đưa AI vào nhận thức công chúng, mở màn kỷ nguyên mới của trí tuệ nhân tạo.
Đặc trưng của thời kỳ này là sự kết hợp giữa dữ liệu lớn, tài nguyên tính toán mạnh mẽ và thuật toán học sâu. Sự phổ biến của internet cho phép thu thập lượng dữ liệu khổng lồ, trong khi sự phát triển của GPU cung cấp nền tảng tính toán cho việc huấn luyện các mạng nơ-ron lớn.
Các Cột mốc Quan trọng
Sự Trỗi dậy của Phương pháp Thống kê
Trong những năm 1990, các phương pháp thống kê bắt đầu chi phối nghiên cứu AI. Mô hình Markov Ẩn (HMM) trong nhận dạng giọng nói, Naive Bayes và cây quyết định trong học máy, đều đạt được kết quả tốt.
Sự Ra đời của World Wide Web
Tim Berners-Lee tạo ra World Wide Web. Sự phổ biến của internet thay đổi cách sống của con người và cung cấp nguồn dữ liệu chưa từng có cho AI.
Máy Vector Hỗ trợ
Vladimir Vapnik và cộng sự đề xuất Máy Vector Hỗ trợ (SVM), một phương pháp phân loại và hồi quy mạnh mẽ. SVM đạt hiệu suất xuất sắc trong phân loại văn bản và nhận dạng chữ viết tay.
Vladimir Vapnik
Bộ nhớ Dài-Ngắn hạn (LSTM)
Sepp Hochreiter và Jürgen Schmidhuber đề xuất LSTM, một loại RNN đặc biệt có khả năng học các phụ thuộc dài hạn. LSTM đạt thành công lớn trong nhận dạng giọng nói và mô hình hóa ngôn ngữ.
Sepp Hochreiter & Jürgen Schmidhuber
LeNet-5
Yann LeCun phát triển LeNet-5, một CNN dùng cho nhận dạng chữ số viết tay. LeNet-5 là một trong những mô hình học sâu đầu tiên được triển khai thương mại hóa ở quy mô lớn, được sử dụng trong Bưu điện Mỹ để nhận dạng mã ZIP.
Yann LeCun
Mô hình ngôn ngữ xác suất dùng mạng nơ-ron
Yoshua Bengio, Réjean Ducharme, Pascal Vincent và Christian Jauvin đề xuất mô hình ngôn ngữ xác suất học đồng thời biểu diễn phân tán của từ và xác suất chuỗi từ để giảm lời nguyền số chiều. Mạng này là feed-forward, không phải RNN.
Yoshua Bengio
Chương trình tính toán nơ-ron CIFAR
Từ năm 2004, một chương trình của CIFAR tạo điều kiện trao đổi thường xuyên giữa Geoffrey Hinton, Yann LeCun, Yoshua Bengio và cộng sự. Chương trình giúp phối hợp nghiên cứu góp phần vào sự phục hưng của deep learning, nhưng không phải một điểm khởi đầu duy nhất.
Geoffrey Hinton
Mạng Niềm tin Sâu
Geoffrey Hinton đề xuất Mạng Niềm tin Sâu (DBN), mạng nơ-ron sâu đầu tiên được huấn luyện thành công. Hinton giới thiệu “tiền huấn luyện từng lớp” để giải quyết khó khăn trong huấn luyện.
Geoffrey Hinton
GPU cho Học Sâu
Các nhà nghiên cứu bắt đầu sử dụng GPU để tăng tốc huấn luyện học sâu. Khả năng tính toán song song của GPU giúp việc huấn luyện các mạng nơ-ron lớn trở nên khả thi.
Bộ dữ liệu ImageNet
Nhóm ImageNet công bố bài báo về cơ sở dữ liệu ảnh phân cấp quy mô lớn vào năm 2009, dùng hệ thống WordNet để tổ chức ảnh được gán nhãn. ImageNet và thử thách nhận dạng sau đó trở thành hạ tầng quan trọng cho huấn luyện và đánh giá thị giác máy tính quy mô lớn.
Fei-Fei Li
Đột phá Nhận dạng Giọng nói
Google sử dụng mô hình học sâu để giảm tỷ lệ lỗi nhận dạng giọng nói xuống 25%. Đây là bước đột phá lớn đầu tiên của học sâu trong nhận dạng giọng nói.
Đột phá ImageNet
Nhóm của Alex Krizhevsky, Ilya Sutskever và Geoffrey Hinton sử dụng AlexNet trong cuộc thi ImageNet, giành chiến thắng áp đảo. Tỷ lệ lỗi giảm từ 26% xuống còn 15%.
Nhóm AlexNet
Word2Vec
Tomas Mikolov công bố Word2Vec, mô hình mạng nơ-ron để học nhúng từ. Word2Vec giúp máy tính hiểu được mối quan hệ ngữ nghĩa giữa các từ.
Tomas Mikolov
Mạng Đối kháng Sinh thành (GAN)
Ian Goodfellow đề xuất GAN, một trong những đổi mới quan trọng nhất trong học sâu. GAN tạo ra hình ảnh cực kỳ chân thực thông qua huấn luyện đối kháng.
Ian Goodfellow
ResNet
Kaiming He và cộng sự đề xuất ResNet, giải quyết khó khăn huấn luyện mạng sâu thông qua các kết nối tắt. ResNet cho phép huấn luyện hàng trăm lớp.
Kaiming He
AlphaGo Đánh bại Lee Sedol
AlphaGo của DeepMind đánh bại nhà vô địch cờ vây thế giới Lee Sedol với tỷ số 4-1. Cờ vây được coi là một trong những trò chơi cờ khó nhất đối với AI.
DeepMind AlphaGo
Kiến trúc Transformer
Google đề xuất kiến trúc Transformer, bước đột phá mang tính cách mạng trong NLP. Transformer là nền tảng của các mô hình ngôn ngữ lớn hiện đại.
Google Brain
Nhân vật Quan trọng
Geoffrey Hinton
Cha đẻ Học Sâu
Hinton, cùng với Yann LeCun và Yoshua Bengio, nhận Giải Turing năm 2018, được mệnh danh là “Bộ ba Học Sâu”. Sự kiên trì và đổi mới của ông đã hoàn toàn thay đổi AI.
Yann LeCun
Cha đẻ CNN
LeCun là Nhà Khoa học AI Trưởng tại Facebook. LeNet-5 của ông là mô hình học sâu thương mại hóa thành công đầu tiên. Những đóng góp của ông cho CNN đặt nền móng cho thị giác máy tính hiện đại.
Yoshua Bengio
Người Tiên phong Học Sâu
Bengio là giáo sư tại Đại học Montreal và là nhân vật quan trọng trong lĩnh vực học sâu. Những đóng góp của ông cho RNN và NLP cũng quan trọng không kém.
Ian Goodfellow
Cha đẻ GAN
Goodfellow đề xuất GAN năm 2014, một phương pháp cách mạng trong AI sinh thành. Từ deepfake đến sáng tạo nghệ thuật, ứng dụng của GAN có mặt ở khắp nơi.
Fei-Fei Li
Mẹ đẻ ImageNet
Li là giáo sư tại Đại học Stanford. Bộ dữ liệu ImageNet của bà có ảnh hưởng sâu sắc đến thị giác máy tính. Bà cũng đồng sáng lập AI4ALL, thúc đẩy sự đa dạng trong giáo dục AI.
Danh ngôn Kinh điển
Học sâu cho phép các mô hình tính toán được cấu thành từ nhiều lớp xử lý học các biểu diễn dữ liệu với nhiều cấp độ trừu tượng.
Nếu trí tuệ là một chiếc bánh, học không giám sát sẽ là chiếc bánh, học có giám sát sẽ là lớp đường phủ trên bánh, và học tăng cường sẽ là quả cherry trên bánh. Chúng ta biết cách làm lớp đường và quả cherry, nhưng không biết cách làm chiếc bánh.
Mục tiêu của chúng tôi là trí tuệ nhân tạo tổng quát.