Training und Nachtraining
SFT / RLHF / DPO
Eine Familie von Nachtrainingsmethoden für Anweisungsbefolgung und präferenzorientiertes Verhalten. SFT lernt aus Demonstrationen; RLHF und DPO nutzen Präferenzvergleiche mit unterschiedlichen Optimierungsverfahren.
Schlüsselbegriffe
- supervised fine-tuning
- preference data
- reward model
- alignment
Verknüpfungen im Projekt
Baut auf
Verwendet von
Verwandte Technologien
Verwandte Arbeiten
Historischer Kontext
Primärquellen
Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.