简体中文
← 返回 AI 技术体系

推理与部署

Continuous Batching / PagedAttention

在连续接纳与移出请求的同时,以分页方式管理 KV 缓存的服务技术。二者结合可提高变长工作负载下的利用率和吞吐量。

时间节点
2022–2023
最近审查

关键术语

  • request scheduling
  • memory paging
  • throughput
  • serving

项目内关联

一手来源

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。