Bahasa Indonesia
← Kembali ke Teknologi AI

Inferensi dan penggelaran

Speculative Decoding

Metode inferensi ketika draf yang lebih cepat mengusulkan beberapa token dan model sasaran memverifikasinya secara paralel. Cara ini dapat menurunkan latensi pembangkitan tanpa mengubah distribusi sasaran.

Periode rujukan
2022
Terakhir ditinjau

Istilah kunci

  • draft model
  • verification
  • latency
  • exact sampling

Terhubung di seluruh proyek

Sumber primer

  1. Fast Inference from Transformers via Speculative Decoding

Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.