हिन्दी
← AI प्रौद्योगिकी पर लौटें

प्रशिक्षण और उत्तर-प्रशिक्षण

SFT / RLHF / DPO

उत्तर-प्रशिक्षण विधियों का एक कुल जो निर्देश-पालन और अभिरुचि के अनुरूप व्यवहार सिखाता है। SFT प्रदर्शनों से सीखता है; RLHF और DPO अभिरुचि की तुलनाओं का उपयोग भिन्न अनुकूलन प्रक्रियाओं से करते हैं।

संदर्भ अवधि
2017 / 2022 / 2023
अंतिम समीक्षा

मुख्य शब्द

  • supervised fine-tuning
  • preference data
  • reward model
  • alignment

पूरी परियोजना में जुड़ाव

किस पर आधारित

किसके द्वारा प्रयुक्त

संबंधित प्रौद्योगिकी

प्राथमिक स्रोत

  1. Deep reinforcement learning from human preferences
  2. Training language models to follow instructions with human feedback
  3. Direct Preference Optimization

यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।