प्रशिक्षण और उत्तर-प्रशिक्षण
SFT / RLHF / DPO
उत्तर-प्रशिक्षण विधियों का एक कुल जो निर्देश-पालन और अभिरुचि के अनुरूप व्यवहार सिखाता है। SFT प्रदर्शनों से सीखता है; RLHF और DPO अभिरुचि की तुलनाओं का उपयोग भिन्न अनुकूलन प्रक्रियाओं से करते हैं।
मुख्य शब्द
- supervised fine-tuning
- preference data
- reward model
- alignment
पूरी परियोजना में जुड़ाव
किस पर आधारित
किसके द्वारा प्रयुक्त
संबंधित प्रौद्योगिकी
ऐतिहासिक संदर्भ
प्राथमिक स्रोत
यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।