简体中文
← 返回 AI 技术体系

推理与部署

Speculative Decoding

由更快的草稿模型提出多个词元,再由目标模型并行验证的推理方法。它可在不改变目标分布的前提下降低生成延迟。

时间节点
2022
最近审查

关键术语

  • draft model
  • verification
  • latency
  • exact sampling

项目内关联

一手来源

  1. Fast Inference from Transformers via Speculative Decoding

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。