한국어
← AI 기술 체계로 돌아가기

학습과 사후 학습

Distributed Training

데이터, 매개변수, 활성값 또는 연산을 여러 장치와 노드에 분할하는 기술이다. 대규모 모델 학습을 가능하게 하지만 통신, 동기화, 내결함성의 절충이 따른다.

기준 시기
2012–present
최근 검토

핵심 용어

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

프로젝트 내 연결

1차 출처

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.