ไทย
← กลับไปยังเทคโนโลยี AI

การฝึกและหลังการฝึก

Distributed Training

เทคนิคที่แบ่งข้อมูล พารามิเตอร์ ค่า activation หรือการคำนวณไปยังอุปกรณ์และโหนดหลายตัว ทำให้ฝึกโมเดลขนาดใหญ่ได้ แต่ต้องแลกกับการสื่อสาร การซิงโครไนซ์ และความทนทานต่อความผิดพลาด

ช่วงเวลาอ้างอิง
2012–present
ตรวจล่าสุด

คำสำคัญ

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

ความเชื่อมโยงในโครงการ

เทคโนโลยีที่เกี่ยวข้อง

บทความที่เกี่ยวข้อง

บริบททางประวัติศาสตร์

แหล่งข้อมูลปฐมภูมิ

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด