Обучение и постобучение
SFT / RLHF / DPO
Семейство методов постобучения для следования инструкциям и согласования с предпочтениями. SFT учится на демонстрациях, а RLHF и DPO используют сравнения предпочтений через разные процедуры оптимизации.
Ключевые термины
- supervised fine-tuning
- preference data
- reward model
- alignment
Связи внутри проекта
Опирается на
Используется в
Связанные технологии
Связанные работы
Исторический контекст
Первичные источники
Это отобранная техническая карта, а не заявление о полном охвате.