Entrenamiento y posentrenamiento
SFT / RLHF / DPO
Una familia de métodos de posentrenamiento para enseñar seguimiento de instrucciones y alineación con preferencias. SFT aprende de demostraciones; RLHF y DPO usan comparaciones mediante optimizaciones distintas.
Términos clave
- supervised fine-tuning
- preference data
- reward model
- alignment
Conexiones en el proyecto
Se basa en
Usado por
Tecnologías relacionadas
Artículos relacionados
Contexto histórico
Fuentes primarias
Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.