Italiano
← Torna alle tecnologie dell’IA

Inferenza e distribuzione

KV Cache

Una cache delle chiavi e dei valori di attenzione dei token precedenti durante la generazione autoregressiva. Evita di ricalcolare l’intero prefisso, ma spesso consuma molta memoria.

Periodo di riferimento
2017–present
Ultima verifica

Termini chiave

  • keys
  • values
  • prefill
  • decode

Collegamenti nel progetto

Fonti primarie

  1. Transformers cache explanation

Questa è una mappa tecnica curata, non una pretesa di copertura completa.