推論與部署
Speculative Decoding
由更快的草稿模型提出多個詞元,再由目標模型平行驗證的推論方法。它可在不改變目標分布的前提下降低生成延遲。
關鍵術語
- draft model
- verification
- latency
- exact sampling
專案內關聯
基於
相關論文
歷史背景
第一手來源
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。
推論與部署
由更快的草稿模型提出多個詞元,再由目標模型平行驗證的推論方法。它可在不改變目標分布的前提下降低生成延遲。
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。