Deutsch
← Zurück zu KI-Technologien

Training und Nachtraining

SFT / RLHF / DPO

Eine Familie von Nachtrainingsmethoden für Anweisungsbefolgung und präferenzorientiertes Verhalten. SFT lernt aus Demonstrationen; RLHF und DPO nutzen Präferenzvergleiche mit unterschiedlichen Optimierungsverfahren.

Referenzzeitraum
2017 / 2022 / 2023
Zuletzt geprüft

Schlüsselbegriffe

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

Verknüpfungen im Projekt

Primärquellen

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.