Tiếng Việt
← Quay lại Công nghệ AI

Huấn luyện và hậu huấn luyện

SFT / RLHF / DPO

Nhóm phương pháp hậu huấn luyện để dạy mô hình làm theo chỉ dẫn và phù hợp với ưu tiên. SFT học từ minh họa; RLHF và DPO dùng so sánh ưu tiên qua các quy trình tối ưu khác nhau.

Giai đoạn tham chiếu
2017 / 2022 / 2023
Kiểm tra gần nhất

Thuật ngữ chính

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Liên kết trong dự án

Nguồn sơ cấp

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.