العربية
العودة إلى تقنيات الذكاء الاصطناعي

الاستدلال والنشر

Continuous Batching / PagedAttention

تقنيات تقديم تقبل الطلبات وتُنهيها باستمرار مع إدارة ذاكرة KV في صفحات. وهما معًا يحسّنان الاستغلال والإنتاجية تحت أحمال متغيّرة الطول.

الفترة المرجعية
2022–2023
آخر مراجعة

المصطلحات الأساسية

  • request scheduling
  • memory paging
  • throughput
  • serving

الروابط عبر المشروع

المصادر الأولية

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

هذه خريطة تقنية منتقاة، لا ادّعاء بتغطية شاملة.