Bahasa Indonesia
← Kembali ke Teknologi AI

Pelatihan dan pascapelatihan

SFT / RLHF / DPO

Keluarga metode pascapelatihan untuk mengajarkan kepatuhan pada instruksi dan perilaku yang selaras dengan preferensi. SFT belajar dari demonstrasi; RLHF dan DPO memakai perbandingan preferensi melalui prosedur optimasi yang berbeda.

Periode rujukan
2017 / 2022 / 2023
Terakhir ditinjau

Istilah kunci

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Terhubung di seluruh proyek

Sumber primer

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.