Tiếng Việt
← Quay lại Công nghệ AI

Suy luận và triển khai

KV Cache

Bộ nhớ đệm các key và value attention của token trước trong quá trình sinh tự hồi quy. Nó tránh tính lại toàn bộ tiền tố nhưng thường tiêu thụ nhiều bộ nhớ.

Giai đoạn tham chiếu
2017–present
Kiểm tra gần nhất

Thuật ngữ chính

  • keys
  • values
  • prefill
  • decode

Liên kết trong dự án

Nguồn sơ cấp

  1. Transformers cache explanation

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.