Français
← Retour aux technologies de l’IA

Inférence et déploiement

Continuous Batching / PagedAttention

Des techniques de service qui ajoutent et retirent continuellement des requêtes tout en gérant le cache KV par pages. Elles améliorent utilisation et débit avec des charges de longueur variable.

Période de référence
2022–2023
Dernière vérification

Termes clés

  • request scheduling
  • memory paging
  • throughput
  • serving

Liens dans le projet

Sources primaires

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.