한국어
← AI 기술 체계로 돌아가기

학습과 사후 학습

SFT / RLHF / DPO

지시 따르기와 선호 정렬 행동을 가르치는 사후 학습 기법군이다. SFT는 시연에서 학습하고, RLHF와 DPO는 서로 다른 최적화 절차로 선호 비교를 활용한다.

기준 시기
2017 / 2022 / 2023
최근 검토

핵심 용어

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

프로젝트 내 연결

1차 출처

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.