Português
← Voltar às tecnologias de IA

Inferência e implantação

KV Cache

Um cache das chaves e valores de atenção de tokens anteriores durante a geração autorregressiva. Evita recalcular todo o prefixo, mas costuma consumir muita memória.

Período de referência
2017–present
Última revisão

Termos-chave

  • keys
  • values
  • prefill
  • decode

Ligações no projeto

Fontes primárias

  1. Transformers cache explanation

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.