繁體中文
← 返回 AI 技術體系

訓練與後訓練

SFT / RLHF / DPO

一組用於訓練指令遵循與偏好對齊行為的後訓練方法。SFT 學習示範資料;RLHF 與 DPO 以不同最佳化過程利用偏好比較。

時間節點
2017 / 2022 / 2023
最近審查

關鍵術語

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

專案內關聯

第一手來源

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。