訓練與後訓練
SFT / RLHF / DPO
一組用於訓練指令遵循與偏好對齊行為的後訓練方法。SFT 學習示範資料;RLHF 與 DPO 以不同最佳化過程利用偏好比較。
關鍵術語
- supervised fine-tuning
- preference data
- reward model
- alignment
專案內關聯
第一手來源
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。
訓練與後訓練
一組用於訓練指令遵循與偏好對齊行為的後訓練方法。SFT 學習示範資料;RLHF 與 DPO 以不同最佳化過程利用偏好比較。
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。