การฝึกและหลังการฝึก
SFT / RLHF / DPO
กลุ่มวิธีหลังการฝึกสำหรับสอนการทำตามคำสั่งและพฤติกรรมที่สอดคล้องกับความพึงพอใจ SFT เรียนจากตัวอย่าง ส่วน RLHF และ DPO ใช้การเปรียบเทียบความพึงพอใจผ่านวิธีปรับให้เหมาะสมต่างกัน
คำสำคัญ
- supervised fine-tuning
- preference data
- reward model
- alignment
ความเชื่อมโยงในโครงการ
ตั้งอยู่บน
ถูกใช้โดย
เทคโนโลยีที่เกี่ยวข้อง
บทความที่เกี่ยวข้อง
บริบททางประวัติศาสตร์
แหล่งข้อมูลปฐมภูมิ
นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด