التدريب وما بعد التدريب
SFT / RLHF / DPO
عائلة من طرائق ما بعد التدريب لتعليم اتّباع التعليمات والسلوك المتوائم مع التفضيلات. يتعلّم SFT من عروض عملية، بينما يستعمل RLHF وDPO مقارنات تفضيلية عبر إجراءات استمثال مختلفة.
المصطلحات الأساسية
- supervised fine-tuning
- preference data
- reward model
- alignment
الروابط عبر المشروع
يبني على
يُستخدَم في
تقنيات ذات صلة
السياق التاريخي
المصادر الأولية
هذه خريطة تقنية منتقاة، لا ادّعاء بتغطية شاملة.