Português
← Voltar às tecnologias de IA

Treino e pós-treino

SFT / RLHF / DPO

Uma família de métodos de pós-treino para ensinar seguimento de instruções e alinhamento de preferências. SFT aprende com demonstrações; RLHF e DPO usam comparações de preferência por otimizações distintas.

Período de referência
2017 / 2022 / 2023
Última revisão

Termos-chave

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Ligações no projeto

Fontes primárias

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.