Huấn luyện và hậu huấn luyện
SFT / RLHF / DPO
Nhóm phương pháp hậu huấn luyện để dạy mô hình làm theo chỉ dẫn và phù hợp với ưu tiên. SFT học từ minh họa; RLHF và DPO dùng so sánh ưu tiên qua các quy trình tối ưu khác nhau.
Thuật ngữ chính
- supervised fine-tuning
- preference data
- reward model
- alignment
Liên kết trong dự án
Dựa trên
Được dùng bởi
Công nghệ liên quan
Bài báo liên quan
Bối cảnh lịch sử
Nguồn sơ cấp
Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.