日本語
← AI 技術体系に戻る

推論と配備

Speculative Decoding

高速なドラフトが複数トークンを提案し、対象モデルが並列検証する推論手法です。対象分布を変えずに生成遅延を短縮できます。

基準時期
2022
最終確認

主要用語

  • draft model
  • verification
  • latency
  • exact sampling

プロジェクト内のつながり

一次資料

  1. Fast Inference from Transformers via Speculative Decoding

これは選定された技術マップであり、網羅性を主張するものではありません。