Die Wiederbelebung
1990er–2010er · Aufstieg des Deep Learning
Mitte der 1990er-Jahre begann mit verbesserter Rechenleistung und der Verbreitung des Internets das maschinelle Lernen, insbesondere das Deep Learning, an Bedeutung zu gewinnen. Diese Periode der KI-Entwicklung lässt sich als „statistische Revolution“ beschreiben — der Übergang von regelbasierten Systemen zu probabilistischen und datengetriebenen Modellen.
2012 gewann Deep Learning den ImageNet-Wettbewerb mit überwältigendem Vorsprung und markierte damit den Beginn der Deep-Learning-Revolution. Seitdem erzielte KI beispiellose Durchbrüche in der Bilderkennung, Spracherkennung und Verarbeitung natürlicher Sprache. 2016 brachte AlphaGos Sieg über Lee Sedol die KI ins öffentliche Bewusstsein und läutete eine neue Ära der künstlichen Intelligenz ein.
Diese Ära ist geprägt durch die Kombination von Big Data, leistungsstarken Rechenressourcen und Deep-Learning-Algorithmen. Die Verbreitung des Internets ermöglichte die Erfassung gewaltiger Datenmengen, während die Entwicklung von GPUs die rechnerische Grundlage für das Training großer neuronaler Netze schuf.
Wichtige Meilensteine
Aufstieg statistischer Methoden
In den 1990er-Jahren begannen statistische Methoden die KI-Forschung zu dominieren. Hidden-Markov-Modelle (HMMs) in der Spracherkennung, Naive Bayes und Entscheidungsbäume im maschinellen Lernen erzielten durchweg gute Ergebnisse.
Geburt des World Wide Web
Tim Berners-Lee erschuf das World Wide Web. Die Verbreitung des Internets veränderte die Lebensweise der Menschen und stellte der KI beispiellose Datenressourcen zur Verfügung.
Support Vector Machine
Vladimir Vapnik und andere schlugen die Support Vector Machine (SVM) vor, eine leistungsstarke Klassifikations- und Regressionsmethode. SVM erzielte hervorragende Ergebnisse bei der Textklassifikation und Handschrifterkennung.
Vladimir Vapnik
Long Short-Term Memory (LSTM)
Sepp Hochreiter und Jürgen Schmidhuber schlugen LSTM vor, eine spezielle Art von RNN, die langfristige Abhängigkeiten lernen kann. LSTM erzielte große Erfolge in der Spracherkennung und Sprachmodellierung.
Sepp Hochreiter & Jürgen Schmidhuber
LeNet-5
Yann LeCun entwickelte LeNet-5, ein CNN zur Erkennung handgeschriebener Ziffern. LeNet-5 war eines der ersten Deep-Learning-Modelle, die in großem Umfang kommerziell eingesetzt wurden, und wurde beim US-Postdienst zur Erkennung von Postleitzahlen eingesetzt.
Yann LeCun
Neuronales probabilistisches Sprachmodell
Yoshua Bengio, Réjean Ducharme, Pascal Vincent und Christian Jauvin schlugen ein neuronales probabilistisches Sprachmodell vor, das verteilte Wortdarstellungen und Wahrscheinlichkeiten von Wortfolgen gemeinsam lernt, um den Fluch der Dimensionalität zu mildern. Das Netz ist vorwärtsgerichtet, nicht rekurrent.
Yoshua Bengio
CIFAR-Programm für neuronale Berechnung
Ab 2004 brachte ein CIFAR-Programm Geoffrey Hinton, Yann LeCun, Yoshua Bengio und weitere Forschende regelmäßig zusammen. Es koordinierte Arbeiten, die zur Deep-Learning-Renaissance beitrugen, war aber kein einzelner universeller Startpunkt.
Geoffrey Hinton
Deep Belief Networks
Geoffrey Hinton schlug Deep Belief Networks (DBN) vor, die ersten erfolgreich trainierten tiefen neuronalen Netze. Hinton führte „schichtweises Vortraining“ ein, um die Schwierigkeiten beim Training zu überwinden.
Geoffrey Hinton
GPU für Deep Learning
Forscher begannen, GPUs zur Beschleunigung des Deep-Learning-Trainings einzusetzen. Die parallele Rechenleistung von GPUs machte das Training großer neuronaler Netze erst möglich.
ImageNet-Datensatz
Das ImageNet-Team veröffentlichte 2009 seine Arbeit über eine mit WordNet hierarchisch organisierte große Bilddatenbank. ImageNet und die spätere Challenge wurden zu wichtiger Infrastruktur für Training und Evaluation im großen Maßstab.
Fei-Fei Li
Durchbruch in der Spracherkennung
Google setzte Deep-Learning-Modelle ein und senkte die Fehlerrate der Spracherkennung um 25 %. Dies war der erste große Durchbruch des Deep Learning in der Spracherkennung.
ImageNet-Durchbruch
Das Team um Alex Krizhevsky, Ilya Sutskever und Geoffrey Hinton setzte AlexNet im ImageNet-Wettbewerb ein und gewann mit überwältigendem Vorsprung. Die Fehlerrate sank von 26 % auf 15 %.
AlexNet-Team
Word2Vec
Tomas Mikolov veröffentlichte Word2Vec, ein neuronales Netzwerkmodell zum Erlernen von Wortvektoren. Word2Vec ermöglichte es Computern, semantische Beziehungen zwischen Wörtern zu verstehen.
Tomas Mikolov
Generative Adversarial Networks (GAN)
Ian Goodfellow schlug GAN vor, eine der wichtigsten Innovationen im Deep Learning. GAN erzeugt durch adversariales Training äußerst realistische Bilder.
Ian Goodfellow
ResNet
Kaiming He und andere schlugen ResNet vor, das die Trainingsschwierigkeiten tiefer Netzwerke durch Skip Connections löste. ResNet ermöglichte das Training von Netzen mit Hunderten von Schichten.
Kaiming He
AlphaGo besiegt Lee Sedol
DeepMinds AlphaGo besiegte den Go-Weltmeister Lee Sedol mit 4:1. Go galt als eines der für KI schwierigsten Brettspiele.
DeepMind AlphaGo
Transformer-Architektur
Google schlug die Transformer-Architektur vor, einen revolutionären Durchbruch in der Verarbeitung natürlicher Sprache. Der Transformer ist die Grundlage moderner großer Sprachmodelle.
Google Brain
Wichtige Persönlichkeiten
Geoffrey Hinton
Vater des Deep Learning
Hinton erhielt gemeinsam mit Yann LeCun und Yoshua Bengio 2018 den Turing-Preis und ist als „Deep-Learning-Trio“ bekannt. Seine Beharrlichkeit und Innovation haben die KI grundlegend verändert.
Yann LeCun
Vater der CNNs
LeCun ist Chef-KI-Wissenschaftler bei Facebook. Sein LeNet-5 war eines der ersten Deep-Learning-Modelle, die in großem Umfang kommerziell eingesetzt wurden. Seine Beiträge zu CNNs legten den Grundstein für die moderne Computer Vision.
Yoshua Bengio
Pionier des Deep Learning
Bengio ist Professor an der Universität Montreal und eine wichtige Persönlichkeit des Deep Learning. Seine Beiträge zu RNNs und NLP sind gleichermaßen bedeutsam.
Ian Goodfellow
Vater der GANs
Goodfellow schlug 2014 GAN vor, eine revolutionäre Methode der generativen KI. Von Deepfakes bis zur künstlerischen Schöpfung sind die Anwendungen von GAN allgegenwärtig.
Fei-Fei Li
Mutter von ImageNet
Li ist Professorin an der Stanford University. Ihr ImageNet-Datensatz hatte tiefgreifende Auswirkungen auf die Computer Vision. Sie ist auch Mitbegründerin von AI4ALL und fördert die Vielfalt in der KI-Bildung.
Berühmte Zitate
Deep Learning ermöglicht es Rechenmodellen, die aus mehreren Verarbeitungsschichten bestehen, Datenrepräsentationen mit mehreren Abstraktionsebenen zu erlernen.
Wenn Intelligenz ein Kuchen wäre, wäre unüberwachtes Lernen der Kuchen, überwachtes Lernen die Glasur auf dem Kuchen, und verstärkendes Lernen die Kirsche auf dem Kuchen. Wir wissen, wie man die Glasur und die Kirsche macht, aber wir wissen nicht, wie man den Kuchen macht.
Unser Ziel ist künstliche allgemeine Intelligenz.