Italiano
← Torna alle tecnologie dell’IA

Training e post-training

Distributed Training

Tecniche che suddividono dati, parametri, attivazioni o calcolo tra dispositivi e nodi. Rendono possibile addestrare grandi modelli, introducendo compromessi di comunicazione, sincronizzazione e resilienza.

Periodo di riferimento
2012–present
Ultima verifica

Termini chiave

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

Collegamenti nel progetto

Fonti primarie

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

Questa è una mappa tecnica curata, non una pretesa di copertura completa.