Bahasa Indonesia
← Kembali ke Teknologi AI

Inferensi dan penggelaran

Continuous Batching / PagedAttention

Teknik penyajian yang terus-menerus menerima dan melepas permintaan sembari mengelola memori tembolok KV dalam laman. Bersama-sama keduanya memperbaiki utilisasi dan keluaran pada beban kerja berpanjang beragam.

Periode rujukan
2022–2023
Terakhir ditinjau

Istilah kunci

  • request scheduling
  • memory paging
  • throughput
  • serving

Terhubung di seluruh proyek

Sumber primer

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.