Русский
← Назад к технологиям ИИ

Обучение и постобучение

SFT / RLHF / DPO

Семейство методов постобучения для следования инструкциям и согласования с предпочтениями. SFT учится на демонстрациях, а RLHF и DPO используют сравнения предпочтений через разные процедуры оптимизации.

Опорный период
2017 / 2022 / 2023
Последняя проверка

Ключевые термины

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Связи внутри проекта

Первичные источники

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Это отобранная техническая карта, а не заявление о полном охвате.