Español
← Volver a Tecnologías de IA

Entrenamiento y posentrenamiento

SFT / RLHF / DPO

Una familia de métodos de posentrenamiento para enseñar seguimiento de instrucciones y alineación con preferencias. SFT aprende de demostraciones; RLHF y DPO usan comparaciones mediante optimizaciones distintas.

Periodo de referencia
2017 / 2022 / 2023
Última revisión

Términos clave

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Conexiones en el proyecto

Fuentes primarias

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.