प्रशिक्षण और उत्तर-प्रशिक्षण
Reasoning and test-time compute
वह उत्तर-प्रशिक्षण जो मॉडल को उत्तर देने से पहले लम्बा तर्क-सूत्र रचना सिखाता है, और कठिन प्रश्न पर अनुमान के समय अधिक संगणना खर्च करना सिखाता है। सत्यापन-योग्य पुरस्कारों वाला पुनर्बलन अधिगम — जहाँ जाँचा जा सकने वाला उत्तर ही प्रशिक्षण-संकेत देता है — वही है जिसने इस रास्ते को बंद प्रयोगशालाओं के बाहर दोहराने योग्य बनाया। समझौता साफ़ कहने लायक है: शुद्धता बड़े मॉडल से नहीं, लम्बे सृजन से ख़रीदी जाती है, और उसकी क़ीमत विलम्ब तथा परोसने की लागत में चुकाई जाती है।
मुख्य शब्द
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
पूरी परियोजना में जुड़ाव
किस पर आधारित
संबंधित प्रौद्योगिकी
संबंधित शोधपत्र
ऐतिहासिक संदर्भ
प्राथमिक स्रोत
यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।