Inferencia y despliegue
Continuous Batching / PagedAttention
Técnicas de servicio que incorporan y retiran solicitudes continuamente mientras gestionan la caché KV por páginas. Mejoran utilización y rendimiento con cargas de longitud variable.
Términos clave
- request scheduling
- memory paging
- throughput
- serving
Conexiones en el proyecto
Se basa en
Usado por
Tecnologías relacionadas
Artículos relacionados
Contexto histórico
Fuentes primarias
Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.