Deutsch
← Zurück zu KI-Technologien

Inferenz und Bereitstellung

Continuous Batching / PagedAttention

Serving-Techniken, die Anfragen fortlaufend aufnehmen und abschließen und den KV-Cache seitenweise verwalten. Sie verbessern Auslastung und Durchsatz bei variablen Sequenzlängen.

Referenzzeitraum
2022–2023
Zuletzt geprüft

Schlüsselbegriffe

  • request scheduling
  • memory paging
  • throughput
  • serving

Verknüpfungen im Projekt

Primärquellen

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.