Español
← Volver a Tecnologías de IA

Entrenamiento y posentrenamiento

Distributed Training

Técnicas que reparten datos, parámetros, activaciones o cómputo entre dispositivos y nodos. Permiten entrenar modelos grandes, pero introducen compromisos de comunicación, sincronización y tolerancia a fallos.

Periodo de referencia
2012–present
Última revisión

Términos clave

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
  • sharding

Conexiones en el proyecto

Fuentes primarias

  1. ImageNet Classification with Deep Convolutional Neural Networks
  2. Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM
  3. PyTorch Fully Sharded Data Parallel

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.