TECHNOLOGY GRAPH
Tecnologie dell’IA
Dalle architetture e dal training all’inferenza, alla distribuzione e ai modelli a pesi aperti
Una mappa curata degli strati che trasformano idee di ricerca in modelli addestrabili e sistemi utilizzabili. Ogni voce collega articoli, storia, casi di modello, strumenti e fonti primarie.
Architettura dei modelli
Strutture che determinano come i modelli rappresentano e trasformano le informazioni.
Transformer
Un’architettura neurale basata sull’attenzione che elabora in parallelo le posizioni di una sequenza. È diventata la base di molti moderni modelli linguistici e multimodali.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
Una famiglia di architetture con esperti instradati. Le varianti sparse moderne attivano solo alcuni esperti per input, aumentando la capacità senza usare tutti i parametri per ogni token.
- experts
- router
- sparse activation
Diffusion Model
Un modello generativo che impara a invertire un processo graduale di aggiunta del rumore. Il denoising iterativo è diventato centrale nella generazione di immagini, audio, video e contenuti multimodali.
- forward noise
- denoising
- score matching
Framework e rappresentazione
Software e interfacce dati usati per costruire, addestrare ed eseguire modelli.
PyTorch
Un framework open source per tensori e deep learning con differenziazione automatica, moduli neurali, compilazione ed esecuzione distribuita. È usato dalla prototipazione alla formazione in produzione.
- tensor
- autograd
- module
Hugging Face Transformers
Una libreria di definizione dei modelli che collega architetture preaddestrate agli ecosistemi di training e inferenza. Standardizza configurazione, pre-elaborazione, caricamento, generazione e interfacce per molti compiti.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
La mappatura del testo grezzo nelle unità discrete elaborate dal modello. Vocabolario e segmentazione influenzano lunghezza della sequenza, copertura multilingue, costo e comportamento.
- token
- vocabulary
- BPE
Training e post-training
Metodi di scala, adattamento e preferenza che plasmano capacità e comportamento.
Distributed Training
Tecniche che suddividono dati, parametri, attivazioni o calcolo tra dispositivi e nodi. Rendono possibile addestrare grandi modelli, introducendo compromessi di comunicazione, sincronizzazione e resilienza.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
Una famiglia di metodi di post-training per insegnare a seguire istruzioni e preferenze. SFT apprende da dimostrazioni; RLHF e DPO usano confronti di preferenza con procedure di ottimizzazione diverse.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
Un post-addestramento che insegna al modello a produrre una lunga traccia di ragionamento prima di rispondere e a spendere più calcolo in inferenza quando il problema è più difficile. L’apprendimento per rinforzo con ricompense verificabili — dove una risposta controllabile fornisce il segnale di addestramento — è ciò che ha reso l’approccio riproducibile fuori dai laboratori chiusi. Il compromesso va detto con chiarezza: accuratezza ottenuta dalla lunghezza della generazione anziché da un modello più grande, pagata in latenza e costo di servizio.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
Metodi di fine-tuning efficienti che addestrano piccoli adattatori a basso rango mantenendo congelati i pesi di base. QLoRA aggiunge un modello base quantizzato per ridurre ulteriormente la memoria.
- low-rank adapters
- frozen base model
- 4-bit training
Inferenza e distribuzione
Tecniche di memoria, pianificazione, compressione e runtime per servire i modelli.
Quantization
La rappresentazione di pesi, attivazioni o cache con precisione numerica inferiore. Riduce memoria, banda e calcolo, con compromessi di accuratezza e supporto hardware.
- precision
- INT8
- INT4
KV Cache
Una cache delle chiavi e dei valori di attenzione dei token precedenti durante la generazione autoregressiva. Evita di ricalcolare l’intero prefisso, ma spesso consuma molta memoria.
- keys
- values
- prefill
Continuous Batching / PagedAttention
Tecniche di serving che ammettono e completano continuamente richieste gestendo la cache KV a pagine. Migliorano utilizzo e throughput con carichi di lunghezza variabile.
- request scheduling
- memory paging
- throughput
Speculative Decoding
Un metodo di inferenza in cui un modello bozza più rapido propone più token e il modello target li verifica in parallelo. Può ridurre la latenza senza cambiare la distribuzione target.
- draft model
- verification
- latency
Open-model Inference Ecosystem
Motori e runtime come vLLM e llama.cpp trasformano pesi scaricabili in inferenza locale o server. Le priorità variano tra throughput, portabilità hardware, formati e complessità operativa.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
Architettura applicativa
I modelli diventano prodotti tramite workflow, strumenti, scambio di contesto, protezioni e valutazione. Le sezioni MCP e Strumenti coprono questo livello senza duplicarlo qui.
Casi di modelli aperti
Famiglie esaminate attraverso codice, pesi, divulgazione del training e licenza.
Llama
La famiglia di Meta con pesi scaricabili ha ampliato inferenza locale e fine-tuning. Le condizioni specifiche Llama rendono «pesi aperti» più preciso dell’assumere l’open source secondo l’OSI.
- open weights
- community license
- model family
Qwen
La famiglia Qwen di Alibaba comprende versioni dense, a esperti, multilingue e multimodali. Molti checkpoint sono scaricabili, ma licenza e divulgazione vanno verificate nella scheda di ciascun modello.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
La famiglia di Mistral AI comprende modelli densi Mistral e modelli Mixtral a esperti. Alcune versioni hanno licenze permissive e altre no; l’apertura va valutata per artefatto.
- dense models
- MoE
- open weights
DeepSeek
Le versioni scaricabili di DeepSeek hanno diffuso lo studio di MoE, post-training del ragionamento e serving efficiente. Codice e pesi possono avere licenze diverse; la divulgazione dei dati è un asse separato.
- MoE
- reasoning
- open weights
Gemma
La famiglia Google con pesi scaricabili collega la ricerca derivata da Gemini a distribuzioni locali, edge e ospitate. Google la definisce aperta, ma l’uso resta soggetto a condizioni Gemma.
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 pubblica la famiglia OLMo con i dati di pre-addestramento, il codice di addestramento, i checkpoint intermedi e i log, oltre ai pesi. Il primo OLMo è uscito nel febbraio 2024, OLMo 2 nel novembre dello stesso anno e Olmo 3 nel novembre 2025, con varianti Base, Instruct e Think da 7B e 32B sotto licenza Apache 2.0. È il caso in cui i quattro elementi da verificare separatamente — codice, pesi, divulgazione dell’addestramento e licenza — sono davvero tutti pubblicati, il che ne fa un termine di paragone per le famiglie che diffondono soltanto i pesi.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
gpt-oss-120b e 20b di OpenAI sono modelli MoE di ragionamento scaricabili per inferenza locale o ospitata. Pesi e implementazioni di riferimento Apache 2.0 ampliano le opzioni di distribuzione, ma il dataset di preaddestramento non è pubblicato.
- open weights
- reasoning
- MoE
GLM-5
La serie GLM-5 di Z.ai è un’ampia famiglia di modelli linguistici MoE per ragionamento, programmazione e lavoro agentico di lungo periodo. GLM-5 è arrivato a febbraio 2026, 5.1 ad aprile, 5.2 a giugno con 753 miliardi di parametri e una finestra di contesto da un milione di token, e 5.3 ad agosto sulla stessa base con interventi post-addestramento; il più piccolo GLM-5.3-Flash è seguito pochi giorni dopo con 320 miliardi di parametri totali e 18 miliardi attivi. La scala dei membri maggiori rende l’auto-hosting oneroso.
- open weights
- MoE
- long context
Kimi K3
Moonshot AI ha pubblicato Kimi K3 nel luglio 2026: un modello linguistico MoE multimodale nativo a pesi aperti, con 2,8 bilioni di parametri totali, 104 miliardi attivi e un contesto da un milione di token. È rivolto a programmazione prolungata, lavoro conoscitivo e agenti con strumenti, ma la distribuzione locale è impegnativa.
- open weights
- MoE
- long context
Questa è una mappa tecnica curata, non una pretesa di copertura completa.