Возрождение
1990-е–2010-е · Расцвет глубокого обучения
В середине 1990-х годов, с ростом вычислительных мощностей и распространением интернета, машинное обучение, особенно глубокое обучение, начало набирать силу. Этот период в развитии ИИ можно охарактеризовать как «статистическую революцию» — переход от систем, основанных на правилах, к вероятностным и ориентированным на данные моделям.
В 2012 году глубокое обучение одержало сокрушительную победу на конкурсе ImageNet, ознаменовав начало революции глубокого обучения. С тех пор ИИ достиг беспрецедентных прорывов в распознавании изображений, распознавании речи и обработке естественного языка. В 2016 году победа AlphaGo над Ли Седолем привлекла внимание широкой публики к ИИ, ознаменовав начало новой эры искусственного интеллекта.
Эта эпоха характеризуется сочетанием больших данных, мощных вычислительных ресурсов и алгоритмов глубокого обучения. Распространение интернета позволило собирать огромные объёмы данных, а развитие GPU обеспечило вычислительную основу для обучения больших нейронных сетей.
Ключевые вехи
Расцвет статистических методов
В 1990-х годах статистические методы начали доминировать в исследованиях ИИ. Скрытые марковские модели (HMM) в распознавании речи, наивный байесовский классификатор и деревья решений в машинном обучении — всё это дало хорошие результаты.
Рождение Всемирной паутины
Тим Бернерс-Ли создал Всемирную паутину. Распространение интернета изменило образ жизни людей и предоставило ИИ беспрецедентные источники данных.
Метод опорных векторов
Владимир Вапник и соавторы предложили метод опорных векторов (SVM) — мощный метод классификации и регрессии. SVM показал отличные результаты в классификации текстов и распознавании рукописного ввода.
Владимир Вапник
Долгая краткосрочная память (LSTM)
Зепп Хохрайтер и Юрген Шмидхубер предложили LSTM — особый тип рекуррентной нейронной сети, способный обучаться долгосрочным зависимостям. LSTM добился большого успеха в распознавании речи и языковом моделировании.
Зепп Хохрайтер и Юрген Шмидхубер
LeNet-5
Ян Лекун разработал LeNet-5 — свёрточную нейронную сеть для распознавания рукописных цифр. LeNet-5 стала одной из первых моделей глубокого обучения, развёрнутых в крупном коммерческом масштабе, использованной Почтовой службой США для распознавания почтовых индексов.
Ян Лекун
Нейронная вероятностная языковая модель
Йошуа Бенжио, Режан Дюшарм, Паскаль Венсан и Кристиан Жовен предложили нейронную вероятностную языковую модель, совместно обучающую распределённые представления слов и вероятности последовательностей для борьбы с проклятием размерности. Сеть является прямого распространения, а не рекуррентной.
Иошуа Бенжио
Программа CIFAR по нейронным вычислениям
С 2004 года программа CIFAR поддерживала регулярный обмен между Джеффри Хинтоном, Яном Лекуном, Йошуа Бенжио и коллегами. Она помогла координировать исследования, внесшие вклад в возрождение глубокого обучения, но не была единой точкой его начала.
Джеффри Хинтон
Глубокие сети доверия
Джеффри Хинтон предложил глубокие сети доверия (DBN) — первую успешно обученную глубокую нейронную сеть. Хинтон ввёл «послойное предварительное обучение» для решения трудностей обучения.
Джеффри Хинтон
GPU для глубокого обучения
Исследователи начали использовать GPU для ускорения обучения глубоких моделей. Параллельные вычисления на GPU сделали возможным обучение больших нейронных сетей.
Набор данных ImageNet
Команда ImageNet в 2009 году опубликовала работу о крупной иерархической базе размеченных изображений, организованной с помощью WordNet. ImageNet и последующее соревнование стали важной инфраструктурой для масштабного обучения и оценки.
Фэй-Фэй Ли
Прорыв в распознавании речи
Google использовал модели глубокого обучения, снизив уровень ошибок распознавания речи на 25%. Это был первый крупный прорыв глубокого обучения в распознавании речи.
Прорыв на ImageNet
Команда Алекса Крижевского, Ильи Суцкевера и Джеффри Хинтона использовала AlexNet на конкурсе ImageNet, одержав сокрушительную победу. Уровень ошибок снизился с 26% до 15%.
Команда AlexNet
Word2Vec
Томаш Миколов выпустил Word2Vec — нейросетевую модель для обучения векторных представлений слов. Word2Vec позволил компьютерам понимать семантические связи между словами.
Томаш Миколов
Генеративно-состязательные сети (GAN)
Иэн Гудфеллоу предложил GAN — одну из важнейших инноваций в глубоком обучении. GAN генерирует чрезвычайно реалистичные изображения путём состязательного обучения.
Иэн Гудфеллоу
ResNet
Каймин Хе и соавторы предложили ResNet, решив проблему обучения глубоких сетей с помощью skip-соединений. ResNet позволил обучать сети из сотен слоёв.
Каймин Хе
AlphaGo побеждает Ли Седоля
AlphaGo от DeepMind победил чемпиона мира по го Ли Седоля со счётом 4:1. Го считалась одной из самых сложных настольных игр для ИИ.
DeepMind AlphaGo
Архитектура Transformer
Google предложил архитектуру Transformer — революционный прорыв в NLP. Transformer является основой современных крупных языковых моделей.
Google Brain
Ключевые фигуры
Джеффри Хинтон
Отец глубокого обучения
Хинтон вместе с Яном Лекуном и Иошуа Бенжио получил премию Тьюринга в 2018 году, известен как «трио глубокого обучения». Его упорство и инновации полностью преобразили ИИ.
Ян Лекун
Отец свёрточных нейронных сетей
Лекун — главный научный сотрудник по ИИ в Facebook. Его LeNet-5 стала одной из первых моделей глубокого обучения, развёрнутых в крупном коммерческом масштабе. Его вклад в CNN заложил основу современного компьютерного зрения.
Иошуа Бенжио
Пионер глубокого обучения
Бенжио — профессор Монреальского университета и важная фигура в глубоком обучении. Его вклад в RNN и NLP не менее значим.
Иэн Гудфеллоу
Отец GAN
Гудфеллоу предложил GAN в 2014 году — революционный метод в генеративном ИИ. От дипфейков до художественного творчества — применения GAN повсеместны.
Фэй-Фэй Ли
Мать ImageNet
Ли — профессор Стэнфордского университета. Её набор данных ImageNet оказал глубокое влияние на компьютерное зрение. Она также стала соучредителем AI4ALL, продвигая разнообразие в образовании в области ИИ.
Известные цитаты
Глубокое обучение позволяет вычислительным моделям, состоящим из нескольких слоёв обработки, обучаться представлениям данных с множеством уровней абстракции.
Если бы интеллект был тортом, обучение без учителя было бы самим тортом, обучение с учителем было бы глазурью на торте, а обучение с подкреплением — вишенкой на торте. Мы знаем, как сделать глазурь и вишенку, но не знаем, как сделать сам торт.
Наша цель — искусственный общий интеллект.