Español
← Volver a Tecnologías de IA

Inferencia y despliegue

KV Cache

Una caché de claves y valores de atención de tokens anteriores durante la generación autorregresiva. Evita recalcular todo el prefijo, pero suele consumir mucha memoria.

Periodo de referencia
2017–present
Última revisión

Términos clave

  • keys
  • values
  • prefill
  • decode

Conexiones en el proyecto

Fuentes primarias

  1. Transformers cache explanation

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.