Pelatihan dan pascapelatihan
Reasoning and test-time compute
Pascapelatihan yang mengajari model menghasilkan jejak penalaran panjang sebelum menjawab, dan membelanjakan lebih banyak komputasi saat inferensi ketika persoalannya lebih sulit. Pembelajaran penguatan dengan imbalan yang dapat diperiksa — ketika jawaban yang bisa dicek memasok sinyal pelatihan — itulah yang membuat pendekatan ini dapat direproduksi di luar laboratorium tertutup. Pertukarannya perlu dikatakan terus terang: ketepatan yang dibeli dengan panjang pembangkitan alih-alih dengan model yang lebih besar, dan dibayar dengan latensi serta biaya penyajian.
Istilah kunci
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Terhubung di seluruh proyek
Dibangun di atas
Teknologi terkait
Makalah terkait
Konteks sejarah
Sumber primer
Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.