训练与后训练
SFT / RLHF / DPO
一组用于训练指令遵循与偏好对齐行为的后训练方法。SFT 学习示范数据;RLHF 与 DPO 以不同优化过程利用偏好比较。
关键术语
- supervised fine-tuning
- preference data
- reward model
- alignment
项目内关联
一手来源
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。
训练与后训练
一组用于训练指令遵循与偏好对齐行为的后训练方法。SFT 学习示范数据;RLHF 与 DPO 以不同优化过程利用偏好比较。
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。