Inferenza e distribuzione
Continuous Batching / PagedAttention
Tecniche di serving che ammettono e completano continuamente richieste gestendo la cache KV a pagine. Migliorano utilizzo e throughput con carichi di lunghezza variabile.
Termini chiave
- request scheduling
- memory paging
- throughput
- serving
Collegamenti nel progetto
Si basa su
Usato da
Tecnologie correlate
Contesto storico
Fonti primarie
Questa è una mappa tecnica curata, non una pretesa di copertura completa.