Inférence et déploiement
Continuous Batching / PagedAttention
Des techniques de service qui ajoutent et retirent continuellement des requêtes tout en gérant le cache KV par pages. Elles améliorent utilisation et débit avec des charges de longueur variable.
Termes clés
- request scheduling
- memory paging
- throughput
- serving
Liens dans le projet
Repose sur
Utilisé par
Technologies liées
Contexte historique
Sources primaires
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.