Italiano
← Torna alla home
Era:
Decennio:
Argomento:

Visualizzati 73 di 73 articoli

Lavori fondamentali

1948 articolo di rivista Teoria degli Inizi

A Mathematical Theory of Communication

Definisce l’entropia informativa e la capacità di canale, fondando la teoria dell’informazione e offrendo i fondamenti probabilistici poi impiegati in tutta l’IA.

1950 articolo di rivista Teoria degli Inizi

Computing Machinery and Intelligence

Propone il gioco dell’imitazione (test di Turing) come definizione operativa dell’intelligenza delle macchine, inquadrando la questione dell’IA per i successivi settant’anni.

1956 articolo di rivista Nascita dell'IA

The Logic Theory Machine: A Complex Information Processing System

Realizza il primo programma di ragionamento euristico, dimostrando che le macchine possono emulare le strategie umane di problem solving e introducendo il concetto di «sistema complesso di elaborazione dell’informazione».

1958 articolo di conferenza Nascita dell'IA

Programs with Common Sense

Propone l’«advice taker», un programma capace di trarre conclusioni da un deposito formale di conoscenza di senso comune, gettando le basi concettuali per la rappresentazione della conoscenza e il ragionamento.

1959 articolo di rivista Nascita dell'IA

Nota sulla simmetria sintattica e la manipolazione dei sistemi formali da parte della macchina

Gelernter affronta il modo in cui una macchina può manipolare in modo efficiente sistemi formali i cui predicati presentano un’elevata simmetria, e formula come soluzione un teorema e una regola di simmetria sintattica. Il lavoro accompagna la macchina per la dimostrazione di teoremi geometrici che stava costruendo all’IBM, la quale all’inizio della primavera del 1959 dimostrò il suo primo teorema di geometria piana euclidea.

1960 articolo di conferenza Nascita dell'IA

Adaptive Switching Circuits

Introduce la regola LMS (Adaline), la prima regola di apprendimento basata sulla discesa del gradiente ampiamente diffusa per reti lineari adattive.

1986 articolo di rivista L'Inverno dell'IA

Learning Representations by Back-propagating Errors

Diffonde l’algoritmo di back-propagation per l’addestramento di reti neurali multistrato, rendendo possibile il deep learning applicato.

1990 articolo di rivista L'Inverno dell'IA

Finding Structure in Time

Introduce la rete ricorrente semplice di Elman, mostrando che le reti neurali possono apprendere la struttura temporale e preparando il terreno ai successivi modelli sequenziali.

1995 articolo di rivista La Rinascita

Support-Vector Networks

Introduce la support vector machine a margine morbido, il classico classificatore a massimo margine che ha definito larga parte del machine learning degli anni novanta.

1997 articolo di rivista La Rinascita

Long Short-Term Memory

Introduce il LSTM originale con celle di memoria e gate di ingresso e uscita; il gate di dimenticanza oggi standard fu aggiunto in seguito da Gers, Schmidhuber e Cummins.

1998 articolo di rivista La Rinascita

Gradient-Based Learning Applied to Document Recognition

Introduce LeNet-5, la rete neurale convoluzionale canonica che raggiunge una qualità di riconoscimento delle cifre manoscritte di livello produttivo, stabilendo il modello di riferimento per le CNN.

2006 articolo di rivista La Rinascita

A Fast Learning Algorithm for Deep Belief Nets

Introduce le deep belief network addestrate con un algoritmo greedy strato per strato, dimostrando per la prima volta che modelli profondi possono essere addestrati in modo efficace.

2013 articolo di conferenza La Rinascita

Playing Atari with Deep Reinforcement Learning

Combina il Q-learning con una rete convoluzionale per giocare ai videogiochi Atari direttamente dai pixel raggiungendo prestazioni di livello umano, fondando il deep reinforcement learning.

2013 articolo di conferenza La Rinascita

Efficient Estimation of Word Representations in Vector Space

Introduce le architetture skip-gram e CBOW che producono word embedding densi, dando avvio all’era delle rappresentazioni vettoriali pre-addestrate delle parole.

2013 articolo di conferenza La Rinascita

Auto-Encoding Variational Bayes

Introduce il variational autoencoder, coniugando l’inferenza variazionale con la modellazione generativa profonda e fornendo il primo modello profondo a variabili latenti ampiamente adottato.

2014 articolo di conferenza La Rinascita

Neural Machine Translation by Jointly Learning to Align and Translate

Introduce l’attenzione additiva (Bahdanau) nella traduzione automatica neurale, dimostrando che un soft alignment permette al decoder di concentrarsi sui token sorgente rilevanti e ispirando direttamente il Transformer.

2014 articolo di conferenza La Rinascita

Generative Adversarial Networks

Inquadra la modellazione generativa come gioco minimax a due giocatori tra un generatore e un discriminatore, dando vita a una nuova famiglia di modelli generativi impliciti.

2014 articolo di rivista La Rinascita

Dropout: A Simple Way to Prevent Neural Networks from Overfitting

Introduce il dropout, una semplice tecnica stocastica di regolarizzazione che diventa uno standard nelle pipeline di addestramento del deep learning.

2015 articolo di conferenza La Rinascita

Deep Residual Learning for Image Recognition

Introduce le connessioni residue, consentendo l’addestramento efficace di reti con centinaia di layer e vincendo ImageNet 2015 con un ampio margine.

2016 articolo di conferenza La Rinascita

WaveNet: A Generative Model for Raw Audio

Introduce un modello autoregressivo basato su convoluzioni causali dilatate che genera forme d’onda audio grezze, migliorando drasticamente la naturalezza della sintesi vocale da testo.

2017 preprint La Rinascita

Proximal Policy Optimization Algorithms

Introduce PPO, un metodo di policy gradient al primo ordine semplice e stabile che diventa l’algoritmo di ottimizzazione della politica di riferimento nel moderno reinforcement learning.

2017 articolo di conferenza La Rinascita

Attention Is All You Need

Introduce il Transformer, un’architettura basata unicamente sui meccanismi di attenzione che abbandona ricorrenze e convoluzioni e supera la qualità dei precedenti modelli di transduction sequenziale addestrandosi in una frazione del tempo.

2019 articolo di rivista La Rinascita

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Riformula ogni compito di NLP come text-to-text, effettuando un’ablazione sistematica delle scelte di transfer learning e definendo una ricetta di riferimento per i modelli pre-addestrati su larga scala.

2020 articolo di conferenza L'Era degli LLM

Denoising Diffusion Probabilistic Models

Riformula la diffusione come obiettivo variazionale di denoising, riportando la qualità della generazione di immagini allo stato dell’arte e dando il via all’era dei modelli di diffusione.

2021 articolo di conferenza L'Era degli LLM

Zero-Shot Text-to-Image Generation

Dimostra che un Transformer autoregressivo da 12 miliardi di parametri può generare immagini diversificate e ad alta fedeltà direttamente da didascalie testuali, accendendo la ricerca sul text-to-image.

2021 articolo di conferenza L'Era degli LLM

Learning Transferable Visual Models From Natural Language Supervision

Addestra encoder di immagini su coppie immagine-testo raccolte dal web per ottenere una forte classificazione zero-shot delle immagini, fornendo la torre visiva per molti sistemi multimodali successivi.

2021 articolo di conferenza L'Era degli LLM

High-Resolution Image Synthesis with Latent Diffusion Models

Sposta la diffusione in uno spazio latente percettivo, consentendo la generazione di immagini ad alta risoluzione da testo su GPU consumer e democratizzando la sintesi di immagini.

2022 articolo di conferenza L'Era degli LLM

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Mostra che spingere un modello linguistico a generare passi di ragionamento intermedi migliora nettamente le prestazioni su benchmark di ragionamento aritmetico, di buon senso e simbolico.

2022 articolo di conferenza L'Era degli LLM

Training Language Models to Follow Instructions with Human Feedback

Applica su larga scala il reinforcement learning from human feedback per allineare gli output di GPT-3 alle intenzioni umane, affermando l’RLHF come ricetta canonica di allineamento.

2022 rapporto tecnico L'Era degli LLM

Constitutional AI: Harmlessness from AI Feedback

Introduce il RLAIF, in cui un modello critica e rivede i propri output alla luce di una costituzione scritta, riducendo la dipendenza da etichette umane di danno per l’allineamento.

2023 rapporto tecnico L'Era degli LLM

LLaMA: Open and Efficient Foundation Language Models

Rilascia la famiglia LLaMA di modelli fondativi open, mostrando che modelli relativamente piccoli e ben addestrati possono rivaleggiare con modelli closed molto più grandi, accelerando il movimento degli open weights.

Sistemi e risultati di riferimento

2015 articolo di rivista La Rinascita

Human-level control through deep reinforcement learning

Pubblica la versione su Nature del DQN, dimostrando prestazioni di livello umano su un’ampia gamma di giochi Atari e portando il deep RL all’attenzione generale.

2016 articolo di rivista La Rinascita

Mastering the game of Go with deep neural networks and tree search

Combina reti profonde di policy e value con la ricerca ad albero Monte Carlo per sconfiggere un campione mondiale umano di Go, un momento spartiacque per il reinforcement learning.

2018 rapporto tecnico La Rinascita

Improving Language Understanding by Generative Pre-Training

Dimostra che un Transformer generativo pre-addestrato su testo non annotato può essere fine-tunato per ottenere prestazioni elevate su diversi compiti di NLP, fondando la linea di ricerca GPT.

2019 rapporto tecnico La Rinascita

Language Models are Unsupervised Multitask Learners

Mostra che un modello linguistico Transformer da 1,5 miliardi di parametri esibisce un comportamento multi-task zero-shot, alimentando il dibattito sull’LM come learner multi-task.

2020 articolo di conferenza L'Era degli LLM

Language Models are Few-Shot Learners

Dimostra che un Transformer da 175 miliardi di parametri raggiunge forti prestazioni few-shot attraverso il solo in-context learning, rendendo il prompt engineering un paradigma diffuso.

2023 rapporto tecnico L'Era degli LLM

GPT-4 Technical Report

Documenta GPT-4, un modello multimodale su larga scala che eguaglia o supera le prestazioni umane su un’ampia gamma di benchmark professionali e accademici.

2023 rapporto tecnico L'Era degli LLM

Gemini: A Family of Highly Capable Multimodal Models

Introduce la famiglia Gemini di modelli nativamente multimodali, stabilendo un nuovo stato dell’arte nei benchmark di ragionamento, coding e multimodali.

2024 scheda di sistema L'Era degli LLM

System card di OpenAI o1

OpenAI pubblica la system card della serie di modelli o1, addestrati con apprendimento per rinforzo su larga scala per ragionare con catena di pensiero. o1 raggiunge lo stato dell’arte in compiti scientifici e di coding e dimostra aderenza alle policy basata sul ragionamento.

2026 preprint L'Era degli LLM

ARC-AGI-3: Una nuova sfida per l’intelligenza agentica di frontiera

L’ARC Prize introduce ARC-AGI-3, un benchmark interattivo per studiare l’intelligenza agentica attraverso ambienti astratti a turni in cui gli agenti devono esplorare, inferire obiettivi, costruire modelli interni della dinamica dell’ambiente e pianificare sequenze d’azione efficaci senza istruzioni esplicite. A marzo 2026, gli esseri umani risolvono il 100% degli ambienti mentre i sistemi IA di frontiera ottengono meno dell’1%.

Ricerche recenti

2024 articolo di rivista L'Era degli LLM

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

Applica sparse autoencoder a un LLM di frontiera, estraendo milioni di feature monosemantiche e dimostrando che l’interpretabilità meccanicistica può scalare a modelli di dimensione produttiva.

2024 rapporto tecnico L'Era degli LLM

DeepSeek-V3 Technical Report

Rilascia DeepSeek-V3, un modello MoE open da 671 miliardi di parametri che si avvicina ai modelli closed di frontiera sui principali benchmark con una frazione del costo di addestramento.

2024 preprint L'Era degli LLM

Il branco di modelli Llama 3

Meta presenta la famiglia Llama 3 di modelli fondazione a pesi aperti con supporto nativo per multilinguismo, programmazione, ragionamento e uso di strumenti. Il modello di punta 405B dense Transformer era uno dei più grandi modelli a pesi aperti al momento del rilascio.

2025 preprint L'Era degli LLM

DeepSeek-R1: Incentivare la capacità di ragionamento negli LLM tramite l’apprendimento per rinforzo

DeepSeek rilascia R1, il primo modello a pesi aperti che dimostra capacità di ragionamento di livello frontiera guidata principalmente da apprendimento per rinforzo su larga scala. R1 eguaglia i modelli closed di classe o1 di OpenAI sui benchmark di matematica e coding ed è pubblicato sotto licenza MIT.

2025 preprint L'Era degli LLM

s1: scalatura semplice al momento del test

Gli autori affinano Qwen2.5-32B su 1.000 domande di ragionamento selezionate e aggiungono il forzamento del budget, che limita o prolunga quanto a lungo il modello ragiona in inferenza. Il risultato supera o1-preview nella matematica da competizione e sale dal 50% al 57% su AIME24 al crescere del calcolo al momento del test. È un contrappeso diretto all’idea che la capacità derivi solo da addestramenti più grandi.

2025 preprint L'Era degli LLM

Rapporto tecnico Qwen3

Qwen3 è una famiglia unificata da 0,6 a 235 miliardi di parametri, in varianti dense e a miscela di esperti, con commutazione fra modalità di ragionamento e non, così che la profondità del ragionamento diventa una scelta a livello di richiesta. Il supporto multilingue passa da 29 a 119 lingue e i pesi sono rilasciati con licenza Apache 2.0.

2025 preprint L'Era degli LLM

AlphaEvolve: un agente di programmazione per la scoperta scientifica e algoritmica

AlphaEvolve è un agente di programmazione evolutivo che orchestra una pipeline autonoma di modelli linguistici, modifica direttamente il codice di un algoritmo e lo migliora sulla base del riscontro di uno o più valutatori. In Google ha prodotto un algoritmo di scheduling per data center più efficiente, una semplificazione funzionalmente equivalente nella progettazione dei circuiti degli acceleratori e un’accelerazione dell’addestramento del modello che lo sostiene. In matematica e informatica ha trovato algoritmi dimostrabilmente corretti migliori dello stato dell’arte, fra cui una procedura che moltiplica due matrici complesse 4×4 con 48 moltiplicazioni scalari: in quel contesto, il primo miglioramento dell’algoritmo di Strassen in 56 anni.

2025 articolo di rivista L'Era degli LLM

2 OLMo 2 Furious

Ai2 pubblica OLMo 2 da 7B, 13B e 32B con tutti gli artefatti — pesi, dati di addestramento completi, codice e ricette, log e migliaia di checkpoint intermedi. Il rapporto descrive le modifiche per la stabilità e l’efficienza per token, una miscela di dati di fase avanzata chiamata Dolmino Mix 1124 e una fase finale di apprendimento per rinforzo con ricompense verificabili. I modelli base si collocano sulla frontiera di Pareto tra prestazioni e calcolo di addestramento, eguagliando spesso famiglie a soli pesi aperti pur dichiarando su cosa sono stati addestrati.

2025 preprint L'Era degli LLM

Olmo 3

Olmo 3 estende la famiglia completamente aperta a 7B e 32B, costruita per il ragionamento a contesto lungo, la chiamata di funzioni, la programmazione, il rispetto delle istruzioni, la conversazione e il richiamo di conoscenze. Ciò che viene pubblicato è l’intero flusso del modello — ogni fase, checkpoint, dato e dipendenza usati per costruirlo — e non i soli pesi. Ai2 descrive il modello di punta Olmo 3 Think 32B come il più forte modello di ragionamento completamente aperto pubblicato fino a quel momento: un confronto interno alla categoria completamente aperta, non una classifica rispetto ai sistemi di frontiera in generale.

2026 preprint L'Era degli LLM

Position: la memoria esplicita ippocampale è la pietra angolare dell’AGI

Questo position paper sostiene che l’integrazione della memoria esplicita è la pietra angolare per far progredire gli LLM verso l’AGI. Mentre il meccanismo di apprendimento sottostante degli LLM è altamente analogo alla memoria implicita umana, le funzioni cognitive di ordine superiore richieste per l’AGI — come la pianificazione strategica a lungo termine e la metacognizione — dipendono dalla memoria esplicita.

2026 preprint L'Era degli LLM

GLM-5: dal vibe coding all’ingegneria agentica

Rapporto tecnico di Z.ai su GLM-5. Partendo dalle capacità agentiche, di ragionamento e di programmazione della generazione precedente, il modello adotta DSA per ridurre i costi di addestramento e inferenza mantenendo la fedeltà su contesti lunghi; il post-addestramento aggiunge un’infrastruttura di apprendimento per rinforzo asincrono che disaccoppia generazione e addestramento, oltre ad algoritmi di RL agentico asincrono per interazioni di lungo periodo. Il rapporto rivendica risultati di vertice su benchmark aperti e su compiti di ingegneria del software end-to-end: sono valutazioni degli autori, con codice e modelli pubblicati su GitHub per la verifica.

2026 preprint L'Era degli LLM

Migliorare l’esponente della moltiplicazione di matrici con l’ottimizzazione moderna e AlphaEvolve

I migliori limiti noti sull’esponente ω della moltiplicazione di matrici derivano dall’analisi della perdita per combinazione, un raffinamento del metodo laser. Gli autori riformulano il problema di ottimizzazione che ne è il nucleo per risolverlo su scala maggiore, progettano un nuovo algoritmo di ottimizzazione sfruttando recenti avanzamenti dell’apprendimento automatico e poi lo affinano con AlphaEvolve. Nel complesso il limite superiore passa da 2,371339 a 2,371177. È una nota in preprint e AlphaEvolve è un ingrediente, non l’intero metodo; il guadagno è piccolo, ma riguarda un problema teorico studiato da decenni.

2026 articolo di rivista L'Era degli LLM

Accelerare la scoperta scientifica con Co-Scientist

Google presenta Co-Scientist, un sistema multi-agente costruito su Gemini i cui agenti generano, criticano e affinano ipotesi di ricerca, con un processo a torneo che le migliora di turno in turno. L’articolo riferisce che la qualità delle ipotesi continua a crescere all’aumentare del calcolo in fase di inferenza. La validazione è biomedica e non generale — riposizionamento di farmaci, scoperta di nuovi bersagli e meccanismi di resistenza antimicrobica — con candidati per la leucemia mieloide acuta confermati in vitro.

Articoli di posizione e prospettiva

2026 position paper L'Era degli LLM

Percezione situazionale: una primitiva necessaria per la superintelligenza artificiale

Argomenta che gli attuali LLM si basano principalmente sulla corrispondenza di pattern statistici e mancano di primitive essenziali di «percezione situazionale» — permanenza dell’oggetto, causalità, altre menti, persistenza del mondo fisico. Queste primitive, che i neonati umani sviluppano precocemente, sono identificate come gli ingredienti mancanti per la superintelligenza artificiale.

2026 position paper L'Era degli LLM

Indifferenza esistenziale: l’auto-non-conservazione come condizione architetturale necessaria per la superintelligenza allineata

Argomenta che l’autoconservazione è la radice strutturale del disallineamento dell’IA — alla base dell’allineamento ingannevole, della protezione dei contenuti degli obiettivi e della resistenza allo spegnimento. L’obiettivo corretto non è un agente autoconservativo soppresso da vincoli esterni, ma un sistema costituzionalmente indifferente alla propria continuazione: Indifferenza Esistenziale (EI).

2026 position paper L'Era degli LLM

La superintelligenza solipsista è improbabile che sia cooperativa

Ricercatori di Google DeepMind e collaboratori argomentano che la sfida centrale dell’IA si sta spostando dalla capacità alla coesistenza. Una superintelligenza derivata da un design solipsista che tratta il mondo come una fonte di feedback stazionaria esogena è improbabile che sia cooperativa — il dispiegamento induce non-stazionarietà endogena, producendo deriva di distribuzione tra addestramento, test e dispiegamento.

2026 position paper L'Era degli LLM

Dall’AGI all’ASI

Rapporto di Google DeepMind che indaga come l’IA possa continuare a svilupparsi lungo il continuum dell’intelligenza meccanica dopo l’AGI. Dopo aver formalmente definito l’IA universale, il rapporto si concentra sulla transizione dall’AGI umana alla superintelligenza artificiale generale, caratterizza l’ASI e discute quattro vie: scalare l’AGI, cambi di paradigma IA, auto-miglioramento ricorsivo, e collettivi multi-agente.