日本語
← AI 技術体系に戻る

推論と配備

Continuous Batching / PagedAttention

リクエストを連続的に追加・完了させながら、KV キャッシュをページ単位で管理するサービング技術です。可変長負荷での利用率とスループットを高めます。

基準時期
2022–2023
最終確認

主要用語

  • request scheduling
  • memory paging
  • throughput
  • serving

プロジェクト内のつながり

一次資料

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

これは選定された技術マップであり、網羅性を主張するものではありません。