繁體中文
← 返回 AI 技術體系

推論與部署

Continuous Batching / PagedAttention

在持續接納與移出請求的同時,以分頁方式管理 KV 快取的服務技術。兩者結合可提高變長工作負載下的利用率與吞吐量。

時間節點
2022–2023
最近審查

關鍵術語

  • request scheduling
  • memory paging
  • throughput
  • serving

專案內關聯

第一手來源

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。