हिन्दी
← AI प्रौद्योगिकी पर लौटें

प्रशिक्षण और उत्तर-प्रशिक्षण

Reasoning and test-time compute

वह उत्तर-प्रशिक्षण जो मॉडल को उत्तर देने से पहले लम्बा तर्क-सूत्र रचना सिखाता है, और कठिन प्रश्न पर अनुमान के समय अधिक संगणना खर्च करना सिखाता है। सत्यापन-योग्य पुरस्कारों वाला पुनर्बलन अधिगम — जहाँ जाँचा जा सकने वाला उत्तर ही प्रशिक्षण-संकेत देता है — वही है जिसने इस रास्ते को बंद प्रयोगशालाओं के बाहर दोहराने योग्य बनाया। समझौता साफ़ कहने लायक है: शुद्धता बड़े मॉडल से नहीं, लम्बे सृजन से ख़रीदी जाती है, और उसकी क़ीमत विलम्ब तथा परोसने की लागत में चुकाई जाती है।

संदर्भ अवधि
2024 / 2025
अंतिम समीक्षा

मुख्य शब्द

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

पूरी परियोजना में जुड़ाव

किस पर आधारित

संबंधित प्रौद्योगिकी

प्राथमिक स्रोत

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।