Français
← Retour aux technologies de l’IA

Entraînement et post-entraînement

Distributed Training

Des techniques qui répartissent données, paramètres, activations ou calculs entre appareils et nœuds. Elles permettent l’entraînement de grands modèles, avec des compromis de communication, synchronisation et tolérance aux pannes.

Période de référence
2012–present
Dernière vérification

Termes clés

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

Liens dans le projet

Sources primaires

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.