التدريب وما بعد التدريب
Reasoning and test-time compute
تدريب لاحق يعلّم النموذج أن ينتج أثر استدلال طويلًا قبل الإجابة، وأن ينفق حسابًا أكبر عند الاستدلال كلما صعبت المسألة. والتعلّم المعزّز بمكافآت قابلة للتحقق — حيث تمدّ إجابة قابلة للفحص إشارة التدريب — هو ما جعل المقاربة قابلة لإعادة الإنتاج خارج المختبرات المغلقة. والمقايضة جديرة بأن تُقال صراحةً: دقة تُشترى بطول التوليد لا بنموذج أكبر، ويُدفع ثمنها من زمن الاستجابة وكلفة التقديم.
المصطلحات الأساسية
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
الروابط عبر المشروع
يبني على
تقنيات ذات صلة
أوراق ذات صلة
السياق التاريخي
المصادر الأولية
هذه خريطة تقنية منتقاة، لا ادّعاء بتغطية شاملة.