العربية
العودة إلى تقنيات الذكاء الاصطناعي

التدريب وما بعد التدريب

SFT / RLHF / DPO

عائلة من طرائق ما بعد التدريب لتعليم اتّباع التعليمات والسلوك المتوائم مع التفضيلات. يتعلّم SFT من عروض عملية، بينما يستعمل RLHF وDPO مقارنات تفضيلية عبر إجراءات استمثال مختلفة.

الفترة المرجعية
2017 / 2022 / 2023
آخر مراجعة

المصطلحات الأساسية

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

الروابط عبر المشروع

المصادر الأولية

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

هذه خريطة تقنية منتقاة، لا ادّعاء بتغطية شاملة.