简体中文
← 返回 AI 技术体系

推理与部署

KV Cache

自回归生成过程中保存先前词元注意力键和值的缓存。它避免重复计算完整前缀,但往往成为主要内存消耗项。

时间节点
2017–present
最近审查

关键术语

  • keys
  • values
  • prefill
  • decode

项目内关联

一手来源

  1. Transformers cache explanation

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。