日本語
← AI 技術体系に戻る

学習と後学習

SFT / RLHF / DPO

指示追従と選好に沿う挙動を教えるための後学習手法群です。SFT は実演から学び、RLHF と DPO は異なる最適化手順で選好比較を利用します。

基準時期
2017 / 2022 / 2023
最終確認

主要用語

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

プロジェクト内のつながり

一次資料

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

これは選定された技術マップであり、網羅性を主張するものではありません。