Português
← Voltar às tecnologias de IA

Inferência e implantação

Continuous Batching / PagedAttention

Técnicas de serviço que admitem e concluem pedidos continuamente, gerindo o cache KV em páginas. Melhoram utilização e débito com cargas de comprimento variável.

Período de referência
2022–2023
Última revisão

Termos-chave

  • request scheduling
  • memory paging
  • throughput
  • serving

Ligações no projeto

Fontes primárias

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.