简体中文
← 返回 AI 技术体系

训练与后训练

Distributed Training

将数据、参数、激活值或计算拆分到多台设备和节点的技术。它让大模型训练成为可能,同时引入通信、同步与容错权衡。

时间节点
2012–present
最近审查

关键术语

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

项目内关联

一手来源

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。