Deutsch
← Zurück zu KI-Technologien

Inferenz und Bereitstellung

KV Cache

Ein Cache der Attention-Schlüssel und -Werte früherer Tokens bei autoregressiver Generierung. Er vermeidet die Neuberechnung des gesamten Präfixes, benötigt aber häufig viel Speicher.

Referenzzeitraum
2017–present
Zuletzt geprüft

Schlüsselbegriffe

  • keys
  • values
  • prefill
  • decode

Verknüpfungen im Projekt

Primärquellen

  1. Transformers cache explanation

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.