Entraînement et post-entraînement
SFT / RLHF / DPO
Une famille de méthodes de post-entraînement visant le suivi d’instructions et l’alignement sur des préférences. Le SFT apprend de démonstrations, tandis que RLHF et DPO exploitent des comparaisons par des optimisations différentes.
Termes clés
- supervised fine-tuning
- preference data
- reward model
- alignment
Liens dans le projet
Repose sur
Utilisé par
Technologies liées
Contexte historique
Sources primaires
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.