Bahasa Indonesia
← Kembali ke Teknologi AI

Pelatihan dan pascapelatihan

Reasoning and test-time compute

Pascapelatihan yang mengajari model menghasilkan jejak penalaran panjang sebelum menjawab, dan membelanjakan lebih banyak komputasi saat inferensi ketika persoalannya lebih sulit. Pembelajaran penguatan dengan imbalan yang dapat diperiksa — ketika jawaban yang bisa dicek memasok sinyal pelatihan — itulah yang membuat pendekatan ini dapat direproduksi di luar laboratorium tertutup. Pertukarannya perlu dikatakan terus terang: ketepatan yang dibeli dengan panjang pembangkitan alih-alih dengan model yang lebih besar, dan dibayar dengan latensi serta biaya penyajian.

Periode rujukan
2024 / 2025
Terakhir ditinjau

Istilah kunci

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Terhubung di seluruh proyek

Sumber primer

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.