Русский
← Назад к технологиям ИИ

Инференс и развёртывание

Continuous Batching / PagedAttention

Методы обслуживания, непрерывно добавляющие и завершающие запросы и управляющие KV-кэшем постранично. Они повышают загрузку оборудования и пропускную способность при переменной длине запросов.

Опорный период
2022–2023
Последняя проверка

Ключевые термины

  • request scheduling
  • memory paging
  • throughput
  • serving

Связи внутри проекта

Первичные источники

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Это отобранная техническая карта, а не заявление о полном охвате.