Tiếng Việt
← Quay lại Công nghệ AI

Suy luận và triển khai

Continuous Batching / PagedAttention

Kỹ thuật phục vụ liên tục nhận và hoàn tất yêu cầu, đồng thời quản lý KV cache theo trang. Chúng cải thiện mức sử dụng và thông lượng với tải có độ dài thay đổi.

Giai đoạn tham chiếu
2022–2023
Kiểm tra gần nhất

Thuật ngữ chính

  • request scheduling
  • memory paging
  • throughput
  • serving

Liên kết trong dự án

Nguồn sơ cấp

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.