繁體中文
← 返回 AI 技術體系

推論與部署

Speculative Decoding

由更快的草稿模型提出多個詞元,再由目標模型平行驗證的推論方法。它可在不改變目標分布的前提下降低生成延遲。

時間節點
2022
最近審查

關鍵術語

  • draft model
  • verification
  • latency
  • exact sampling

專案內關聯

第一手來源

  1. Fast Inference from Transformers via Speculative Decoding

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。