Português
← Voltar às tecnologias de IA

Treino e pós-treino

Distributed Training

Técnicas que repartem dados, parâmetros, ativações ou computação entre dispositivos e nós. Permitem treinar grandes modelos, mas introduzem compromissos de comunicação, sincronização e tolerância a falhas.

Período de referência
2012–present
Última revisão

Termos-chave

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

Ligações no projeto

Fontes primárias

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.