Italiano
← Torna alle tecnologie dell’IA

Inferenza e distribuzione

Continuous Batching / PagedAttention

Tecniche di serving che ammettono e completano continuamente richieste gestendo la cache KV a pagine. Migliorano utilizzo e throughput con carichi di lunghezza variabile.

Periodo di riferimento
2022–2023
Ultima verifica

Termini chiave

  • request scheduling
  • memory paging
  • throughput
  • serving

Collegamenti nel progetto

Fonti primarie

  1. Orca: A Distributed Serving System for Transformer-Based Generative Models
  2. Efficient Memory Management for Large Language Model Serving with PagedAttention

Questa è una mappa tecnica curata, non una pretesa di copertura completa.