繁體中文
← 返回 AI 技術體系

訓練與後訓練

Distributed Training

將資料、參數、啟用值或計算拆分到多台裝置與節點的技術。它讓大型模型訓練成為可能,同時引入通訊、同步與容錯取捨。

時間節點
2012–present
最近審查

關鍵術語

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

專案內關聯

第一手來源

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。