推論與部署
Continuous Batching / PagedAttention
在持續接納與移出請求的同時,以分頁方式管理 KV 快取的服務技術。兩者結合可提高變長工作負載下的利用率與吞吐量。
關鍵術語
- request scheduling
- memory paging
- throughput
- serving
專案內關聯
第一手來源
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。
推論與部署
在持續接納與移出請求的同時,以分頁方式管理 KV 快取的服務技術。兩者結合可提高變長工作負載下的利用率與吞吐量。
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。