Français
← Retour aux technologies de l’IA

Entraînement et post-entraînement

SFT / RLHF / DPO

Une famille de méthodes de post-entraînement visant le suivi d’instructions et l’alignement sur des préférences. Le SFT apprend de démonstrations, tandis que RLHF et DPO exploitent des comparaisons par des optimisations différentes.

Période de référence
2017 / 2022 / 2023
Dernière vérification

Termes clés

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Liens dans le projet

Sources primaires

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.