日本語
← AI 技術体系に戻る

学習と後学習

Distributed Training

データ、パラメータ、活性値、計算を複数デバイスやノードへ分割する技術です。大規模モデルの学習を可能にする一方、通信、同期、耐障害性のトレードオフを生みます。

基準時期
2012–present
最終確認

主要用語

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

プロジェクト内のつながり

一次資料

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

これは選定された技術マップであり、網羅性を主張するものではありません。