O Renascimento
anos 1990–anos 2010 · Ascensão do Aprendizado Profundo
Em meados da década de 1990, com a melhoria do poder computacional e a popularização da internet, o aprendizado de máquina, especialmente o aprendizado profundo, começou a se destacar. Este período no desenvolvimento da IA pode ser descrito como a «revolução estatística» — uma transição de sistemas baseados em regras para modelos probabilísticos e orientados por dados.
Em 2012, o aprendizado profundo venceu a competição ImageNet por uma margem esmagadora, marcando o início da revolução do aprendizado profundo. Desde então, a IA alcançou avanços sem precedentes em reconhecimento de imagens, reconhecimento de fala e processamento de linguagem natural. Em 2016, a vitória do AlphaGo sobre Lee Sedol trouxe a IA para a consciência pública, inaugurando uma nova era da inteligência artificial.
Esta era é caracterizada pela combinação de grandes volumes de dados, recursos computacionais poderosos e algoritmos de aprendizado profundo. A proliferação da internet tornou possível coletar quantidades massivas de dados, enquanto o desenvolvimento das GPUs forneceu a base computacional para treinar grandes redes neurais.
Marcos importantes
Ascensão dos Métodos Estatísticos
Na década de 1990, os métodos estatísticos começaram a dominar a pesquisa em IA. Modelos Ocultos de Markov (HMMs) no reconhecimento de fala, Naive Bayes e árvores de decisão no aprendizado de máquina, todos obtiveram bons resultados.
Nascimento da World Wide Web
Tim Berners-Lee criou a World Wide Web. A popularização da internet mudou o estilo de vida humano e forneceu recursos de dados sem precedentes para a IA.
Máquina de Vetores de Suporte
Vladimir Vapnik e outros propuseram a Máquina de Vetores de Suporte (SVM), um método poderoso de classificação e regressão. A SVM alcançou excelente desempenho em classificação de textos e reconhecimento de escrita manual.
Vladimir Vapnik
Memória de Longo e Curto Prazo (LSTM)
Sepp Hochreiter e Jürgen Schmidhuber propuseram a LSTM, um tipo especial de RNN capaz de aprender dependências de longo prazo. A LSTM alcançou grande sucesso no reconhecimento de fala e na modelagem de linguagem.
Sepp Hochreiter & Jürgen Schmidhuber
LeNet-5
Yann LeCun desenvolveu a LeNet-5, uma CNN para reconhecimento de dígitos manuscritos. A LeNet-5 foi um dos primeiros modelos de aprendizado profundo implantados em larga escala comercialmente, utilizado pelo Serviço Postal dos EUA para reconhecimento de códigos postais.
Yann LeCun
Modelo de linguagem neural probabilístico
Yoshua Bengio, Réjean Ducharme, Pascal Vincent e Christian Jauvin propuseram um modelo de linguagem neural probabilístico que aprende conjuntamente representações distribuídas de palavras e probabilidades de sequências para enfrentar a maldição da dimensionalidade. A rede é feed-forward, não recorrente.
Yoshua Bengio
Programa CIFAR de computação neural
A partir de 2004, um programa do CIFAR promoveu encontros regulares entre Geoffrey Hinton, Yann LeCun, Yoshua Bengio e colaboradores. A iniciativa coordenou pesquisas que contribuíram para o renascimento do deep learning, sem ser um ponto inicial único.
Geoffrey Hinton
Redes de Crença Profundas
Geoffrey Hinton propôs as Redes de Crença Profundas (DBN), a primeira rede neural profunda treinada com sucesso. Hinton introduziu o «pré-treinamento camada por camada» para resolver as dificuldades de treinamento.
Geoffrey Hinton
GPU para Aprendizado Profundo
Pesquisadores começaram a usar GPUs para acelerar o treinamento de aprendizado profundo. A computação paralela das GPUs tornou possível o treinamento de grandes redes neurais.
Conjunto de Dados ImageNet
A equipe ImageNet publicou em 2009 o artigo sobre uma grande base hierárquica de imagens organizada com WordNet. O ImageNet e seu desafio de reconhecimento tornaram-se infraestrutura importante para treino e avaliação em larga escala.
Fei-Fei Li
Avanço no Reconhecimento de Fala
O Google usou modelos de aprendizado profundo para reduzir a taxa de erro no reconhecimento de fala em 25%. Este foi o primeiro grande avanço do aprendizado profundo no reconhecimento de fala.
Avanço no ImageNet
A equipe de Alex Krizhevsky, Ilya Sutskever e Geoffrey Hinton usou a AlexNet na competição ImageNet, vencendo por uma margem esmagadora. A taxa de erro caiu de 26% para 15%.
Equipe AlexNet
Word2Vec
Tomas Mikolov lançou o Word2Vec, um modelo de rede neural para aprender representações de palavras. O Word2Vec permitiu que os computadores compreendessem as relações semânticas entre palavras.
Tomas Mikolov
Redes Generativas Adversariais (GAN)
Ian Goodfellow propôs a GAN, uma das inovações mais importantes no aprendizado profundo. A GAN gera imagens extremamente realistas por meio de treinamento adversarial.
Ian Goodfellow
ResNet
Kaiming He e outros propuseram a ResNet, resolvendo a dificuldade de treinamento de redes profundas por meio de conexões de salto. A ResNet permitiu o treinamento de centenas de camadas.
Kaiming He
AlphaGo Derrota Lee Sedol
O AlphaGo da DeepMind derrotou o campeão mundial de Go, Lee Sedol, por 4 a 1. O Go era considerado um dos jogos de tabuleiro mais difíceis para a IA.
DeepMind AlphaGo
Arquitetura Transformer
O Google propôs a arquitetura Transformer, uma quebra revolucionária no PLN. O Transformer é a base dos modelos de linguagem modernos de grande escala.
Google Brain
Figuras importantes
Geoffrey Hinton
Pai do Aprendizado Profundo
Hinton, junto com Yann LeCun e Yoshua Bengio, recebeu o Prêmio Turing em 2018, conhecidos como o «Trio do Aprendizado Profundo». Sua persistência e inovação transformaram completamente a IA.
Yann LeCun
Pai das CNNs
LeCun é Cientista-Chefe de IA no Facebook. Sua LeNet-5 foi um dos primeiros modelos de aprendizado profundo implantados em larga escala comercialmente. Suas contribuições para as CNNs estabeleceram as bases da visão computacional moderna.
Yoshua Bengio
Pioneiro do Aprendizado Profundo
Bengio é professor na Universidade de Montreal e uma figura importante no aprendizado profundo. Suas contribuições para RNNs e PLN são igualmente relevantes.
Ian Goodfellow
Pai da GAN
Goodfellow propôs a GAN em 2014, um método revolucionário na IA generativa. De deepfakes à criação artística, as aplicações da GAN são onipresentes.
Fei-Fei Li
Mãe do ImageNet
Li é professora na Universidade de Stanford. Seu conjunto de dados ImageNet teve impacto profundo na visão computacional. Ela também cofundou a AI4ALL, promovendo a diversidade na educação em IA.
Citações célebres
A aprendizagem profunda permite que modelos computacionais compostos por múltiplas camadas de processamento aprendam representações de dados com múltiplos níveis de abstração.
Se a inteligência fosse um bolo, o aprendizado não supervisionado seria o bolo, o aprendizado supervisionado seria a cobertura do bolo, e o aprendizado por reforço seria a cereja do bolo. Sabemos fazer a cobertura e a cereja, mas não sabemos fazer o bolo.
Nosso objetivo é a inteligência artificial geral.