Italiano
← Torna alle tecnologie dell’IA

Training e post-training

SFT / RLHF / DPO

Una famiglia di metodi di post-training per insegnare a seguire istruzioni e preferenze. SFT apprende da dimostrazioni; RLHF e DPO usano confronti di preferenza con procedure di ottimizzazione diverse.

Periodo di riferimento
2017 / 2022 / 2023
Ultima verifica

Termini chiave

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Collegamenti nel progetto

Fonti primarie

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Questa è una mappa tecnica curata, non una pretesa di copertura completa.