ไทย
← กลับไปยังเทคโนโลยี AI

การฝึกและหลังการฝึก

SFT / RLHF / DPO

กลุ่มวิธีหลังการฝึกสำหรับสอนการทำตามคำสั่งและพฤติกรรมที่สอดคล้องกับความพึงพอใจ SFT เรียนจากตัวอย่าง ส่วน RLHF และ DPO ใช้การเปรียบเทียบความพึงพอใจผ่านวิธีปรับให้เหมาะสมต่างกัน

ช่วงเวลาอ้างอิง
2017 / 2022 / 2023
ตรวจล่าสุด

คำสำคัญ

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

ความเชื่อมโยงในโครงการ

ตั้งอยู่บน

ถูกใช้โดย

เทคโนโลยีที่เกี่ยวข้อง

บทความที่เกี่ยวข้อง

บริบททางประวัติศาสตร์

แหล่งข้อมูลปฐมภูมิ

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด