Training e post-training
SFT / RLHF / DPO
Una famiglia di metodi di post-training per insegnare a seguire istruzioni e preferenze. SFT apprende da dimostrazioni; RLHF e DPO usano confronti di preferenza con procedure di ottimizzazione diverse.
Termini chiave
- supervised fine-tuning
- preference data
- reward model
- alignment
Collegamenti nel progetto
Si basa su
Tecnologie correlate
Articoli correlati
Contesto storico
Fonti primarie
Questa è una mappa tecnica curata, non una pretesa di copertura completa.