학습과 사후 학습
SFT / RLHF / DPO
지시 따르기와 선호 정렬 행동을 가르치는 사후 학습 기법군이다. SFT는 시연에서 학습하고, RLHF와 DPO는 서로 다른 최적화 절차로 선호 비교를 활용한다.
핵심 용어
- supervised fine-tuning
- preference data
- reward model
- alignment
프로젝트 내 연결
역사적 맥락
1차 출처
선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.
학습과 사후 학습
지시 따르기와 선호 정렬 행동을 가르치는 사후 학습 기법군이다. SFT는 시연에서 학습하고, RLHF와 DPO는 서로 다른 최적화 절차로 선호 비교를 활용한다.
선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.