Français
← Retour aux technologies de l’IA

Inférence et déploiement

KV Cache

Un cache des clés et valeurs d’attention des jetons précédents pendant la génération autorégressive. Il évite de recalculer tout le préfixe, mais consomme souvent beaucoup de mémoire.

Période de référence
2017–present
Dernière vérification

Termes clés

  • keys
  • values
  • prefill
  • decode

Liens dans le projet

Sources primaires

  1. Transformers cache explanation

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.