Русский
← Назад к технологиям ИИ

Обучение и постобучение

Distributed Training

Методы распределения данных, параметров, активаций или вычислений между устройствами и узлами. Они позволяют обучать крупные модели, но требуют компромиссов в коммуникации, синхронизации и отказоустойчивости.

Опорный период
2012–present
Последняя проверка

Ключевые термины

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

Связи внутри проекта

Первичные источники

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

Это отобранная техническая карта, а не заявление о полном охвате.