简体中文
← 返回 AI 技术体系

训练与后训练

SFT / RLHF / DPO

一组用于训练指令遵循与偏好对齐行为的后训练方法。SFT 学习示范数据;RLHF 与 DPO 以不同优化过程利用偏好比较。

时间节点
2017 / 2022 / 2023
最近审查

关键术语

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

项目内关联

一手来源

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。