हिन्दी
← AI प्रौद्योगिकी पर लौटें

अनुमान और तैनाती

Continuous Batching / PagedAttention

परोसने की वे तकनीकें जो अनुरोधों को लगातार लेती-छोड़ती रहती हैं और KV-संचय की स्मृति को पन्नों में सँभालती हैं। मिलकर ये परिवर्ती लम्बाई वाले भार में उपयोग और निर्गम दोनों बढ़ाती हैं।

संदर्भ अवधि
2022–2023
अंतिम समीक्षा

मुख्य शब्द

  • request scheduling
  • memory paging
  • throughput
  • serving

पूरी परियोजना में जुड़ाव

किस पर आधारित

किसके द्वारा प्रयुक्त

संबंधित प्रौद्योगिकी

प्राथमिक स्रोत

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।