推理与部署
Continuous Batching / PagedAttention
在连续接纳与移出请求的同时,以分页方式管理 KV 缓存的服务技术。二者结合可提高变长工作负载下的利用率和吞吐量。
关键术语
- request scheduling
- memory paging
- throughput
- serving
项目内关联
一手来源
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。
推理与部署
在连续接纳与移出请求的同时,以分页方式管理 KV 缓存的服务技术。二者结合可提高变长工作负载下的利用率和吞吐量。
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。