ไทย
← กลับไปยังเทคโนโลยี AI

การอนุมานและการนำไปใช้

Continuous Batching / PagedAttention

เทคนิคการให้บริการที่รับและนำคำขอออกอย่างต่อเนื่อง พร้อมจัดการหน่วยความจำ KV cache เป็นหน้า ช่วยเพิ่มการใช้ทรัพยากรและ throughput เมื่อความยาวงานแตกต่างกัน

ช่วงเวลาอ้างอิง
2022–2023
ตรวจล่าสุด

คำสำคัญ

  • request scheduling
  • memory paging
  • throughput
  • serving

ความเชื่อมโยงในโครงการ

ตั้งอยู่บน

ถูกใช้โดย

เทคโนโลยีที่เกี่ยวข้อง

บทความที่เกี่ยวข้อง

บริบททางประวัติศาสตร์

แหล่งข้อมูลปฐมภูมิ

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด