Pelatihan dan pascapelatihan
SFT / RLHF / DPO
Keluarga metode pascapelatihan untuk mengajarkan kepatuhan pada instruksi dan perilaku yang selaras dengan preferensi. SFT belajar dari demonstrasi; RLHF dan DPO memakai perbandingan preferensi melalui prosedur optimasi yang berbeda.
Istilah kunci
- supervised fine-tuning
- preference data
- reward model
- alignment
Terhubung di seluruh proyek
Dibangun di atas
Dipakai oleh
Teknologi terkait
Konteks sejarah
Sumber primer
Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.