Treino e pós-treino
SFT / RLHF / DPO
Uma família de métodos de pós-treino para ensinar seguimento de instruções e alinhamento de preferências. SFT aprende com demonstrações; RLHF e DPO usam comparações de preferência por otimizações distintas.
Termos-chave
- supervised fine-tuning
- preference data
- reward model
- alignment
Ligações no projeto
Assenta em
Usado por
Tecnologias relacionadas
Artigos relacionados
Contexto histórico
Fontes primárias
Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.