La Rinascita
anni 1990–anni 2010 · L’Ascesa del Deep Learning
A metà degli anni ’90, con il miglioramento della potenza di calcolo e la diffusione di Internet, il machine learning, in particolare il deep learning, iniziò a emergere. Questo periodo dello sviluppo dell’IA può essere descritto come la «rivoluzione statistica» — un passaggio da sistemi basati su regole a modelli probabilistici e guidati dai dati.
Nel 2012, il deep learning vinse la competizione ImageNet con un margine schiacciante, segnando l’inizio della rivoluzione del deep learning. Da allora, l’IA ha raggiunto traguardi senza precedenti nel riconoscimento delle immagini, nel riconoscimento vocale e nell’elaborazione del linguaggio naturale. Nel 2016, la vittoria di AlphaGo su Lee Sedol portò l’IA nell’immaginario collettivo, inaugurando una nuova era dell’intelligenza artificiale.
Quest’epoca è caratterizzata dalla combinazione di big data, potenti risorse di calcolo e algoritmi di deep learning. La diffusione di Internet rese possibile la raccolta di enormi quantità di dati, mentre lo sviluppo delle GPU fornì la base computazionale per l’addestramento di grandi reti neurali.
Pietre miliari
Ascesa dei Metodi Statistici
Negli anni ’90, i metodi statistici iniziarono a dominare la ricerca sull’IA. I Modelli di Markov Nascosti (HMM) nel riconoscimento vocale, il Naive Bayes e gli alberi decisionali nel machine learning ottennero tutti buoni risultati.
Nascita del World Wide Web
Tim Berners-Lee creò il World Wide Web. La diffusione di Internet cambiò lo stile di vita umano e fornì risorse di dati senza precedenti per l’IA.
Macchine a Vettori di Supporto
Vladimir Vapnik e altri proposero le Macchine a Vettori di Supporto (SVM), un potente metodo di classificazione e regressione. Le SVM ottennero eccellenti prestazioni nella classificazione del testo e nel riconoscimento della scrittura.
Vladimir Vapnik
Long Short-Term Memory (LSTM)
Sepp Hochreiter e Jürgen Schmidhuber proposero l’LSTM, un tipo speciale di RNN in grado di apprendere dipendenze a lungo termine. L’LSTM ottenne grande successo nel riconoscimento vocale e nella modellazione del linguaggio.
Sepp Hochreiter e Jürgen Schmidhuber
LeNet-5
Yann LeCun sviluppò LeNet-5, una CNN per il riconoscimento di cifre scritte a mano. LeNet-5 fu tra i primi modelli di deep learning distribuiti su larga scala in ambito commerciale, utilizzato dal Servizio Postale degli Stati Uniti per il riconoscimento dei codici postali.
Yann LeCun
Modello linguistico neurale probabilistico
Yoshua Bengio, Réjean Ducharme, Pascal Vincent e Christian Jauvin proposero un modello linguistico neurale probabilistico che apprende congiuntamente rappresentazioni distribuite delle parole e probabilità delle sequenze per affrontare la maledizione della dimensionalità. La rete è feed-forward, non ricorrente.
Yoshua Bengio
Programma CIFAR di calcolo neurale
Dal 2004 un programma CIFAR favorì incontri regolari tra Geoffrey Hinton, Yann LeCun, Yoshua Bengio e collaboratori. Coordinò ricerche che contribuirono alla rinascita del deep learning, senza rappresentarne un unico punto di partenza.
Geoffrey Hinton
Reti Deep Belief
Geoffrey Hinton propose le Reti Deep Belief (DBN), la prima rete neurale profonda addestrata con successo. Hinton introdusse il «pre-addestramento strato per strato» per risolvere le difficoltà di addestramento.
Geoffrey Hinton
GPU per il Deep Learning
I ricercatori iniziarono a utilizzare le GPU per accelerare l’addestramento del deep learning. Il calcolo parallelo delle GPU rese possibile l’addestramento di grandi reti neurali.
Dataset ImageNet
Il team ImageNet pubblicò nel 2009 l’articolo sul database gerarchico di immagini organizzato con WordNet. ImageNet e la successiva competizione divennero un’infrastruttura importante per addestramento e valutazione su larga scala.
Fei-Fei Li
Svolta nel Riconoscimento Vocale
Google utilizzò modelli di deep learning per ridurre del 25% il tasso di errore nel riconoscimento vocale. Fu la prima grande svolta del deep learning nel riconoscimento vocale.
Svolta di ImageNet
Il team di Alex Krizhevsky, Ilya Sutskever e Geoffrey Hinton utilizzò AlexNet nella competizione ImageNet, vincendo con un margine schiacciante. Il tasso di errore scese dal 26% al 15%.
Team di AlexNet
Word2Vec
Tomas Mikolov rilasciò Word2Vec, un modello di rete neurale per l’apprendimento di rappresentazioni vettoriali delle parole. Word2Vec permise ai computer di comprendere le relazioni semantiche tra le parole.
Tomas Mikolov
Reti Generative Avversarie (GAN)
Ian Goodfellow propose le GAN, una delle innovazioni più importanti nel deep learning. Le GAN generano immagini estremamente realistiche attraverso l’addestramento avversario.
Ian Goodfellow
ResNet
Kaiming He e altri proposero ResNet, risolvendo la difficoltà di addestramento delle reti profonde attraverso connessioni di salto. ResNet permise l’addestramento di centinaia di strati.
Kaiming He
AlphaGo Sconfigge Lee Sedol
AlphaGo di DeepMind sconfisse il campione mondiale di Go Lee Sedol per 4 a 1. Il Go era considerato uno dei giochi da tavolo più difficili per l’IA.
DeepMind AlphaGo
Architettura Transformer
Google propose l’architettura Transformer, una svolta rivoluzionaria nell’NLP. Il Transformer è la base dei moderni modelli linguistici di grandi dimensioni.
Google Brain
Personaggi importanti
Geoffrey Hinton
Padre del Deep Learning
Hinton, insieme a Yann LeCun e Yoshua Bengio, ricevette il Premio Turing nel 2018, noto come il «Trio del Deep Learning». La sua perseveranza e le sue innovazioni hanno completamente trasformato l’IA.
Yann LeCun
Padre delle CNN
LeCun è Chief AI Scientist presso Facebook. Il suo LeNet-5 fu tra i primi modelli di deep learning distribuiti su larga scala in ambito commerciale. I suoi contributi alle CNN hanno gettato le basi della moderna visione artificiale.
Yoshua Bengio
Pioniere del Deep Learning
Bengio è professore all’Università di Montréal e una figura importante nel deep learning. I suoi contributi alle RNN e all’NLP sono altrettanto importanti.
Ian Goodfellow
Padre delle GAN
Goodfellow propose le GAN nel 2014, un metodo rivoluzionario nell’IA generativa. Dai deepfake alla creazione artistica, le applicazioni delle GAN sono ormai onnipresenti.
Fei-Fei Li
Madre di ImageNet
Li è professoressa alla Stanford University. Il suo dataset ImageNet ebbe un impatto profondo sulla visione artificiale. Ha inoltre co-fondato AI4ALL, promuovendo la diversità nell’educazione all’IA.
Citazioni celebri
Il deep learning consente ai modelli computazionali composti da più strati di elaborazione di apprendere rappresentazioni di dati con più livelli di astrazione.
Se l’intelligenza fosse una torta, l’apprendimento non supervisionato sarebbe la torta, l’apprendimento supervisionato sarebbe la glassa sulla torta, e l’apprendimento per rinforzo sarebbe la ciliegina sulla torta. Sappiamo come fare la glassa e la ciliegina, ma non sappiamo come fare la torta.
Il nostro obiettivo è l’intelligenza artificiale generale.