Español
← Volver a Tecnologías de IA

Inferencia y despliegue

Continuous Batching / PagedAttention

Técnicas de servicio que incorporan y retiran solicitudes continuamente mientras gestionan la caché KV por páginas. Mejoran utilización y rendimiento con cargas de longitud variable.

Periodo de referencia
2022–2023
Última revisión

Términos clave

  • request scheduling
  • memory paging
  • throughput
  • serving

Conexiones en el proyecto

Fuentes primarias

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.