学習と後学習
SFT / RLHF / DPO
指示追従と選好に沿う挙動を教えるための後学習手法群です。SFT は実演から学び、RLHF と DPO は異なる最適化手順で選好比較を利用します。
主要用語
- supervised fine-tuning
- preference data
- reward model
- alignment
プロジェクト内のつながり
基盤とする技術
歴史的背景
一次資料
これは選定された技術マップであり、網羅性を主張するものではありません。
学習と後学習
指示追従と選好に沿う挙動を教えるための後学習手法群です。SFT は実演から学び、RLHF と DPO は異なる最適化手順で選好比較を利用します。
これは選定された技術マップであり、網羅性を主張するものではありません。