Tiếng Việt
← Quay lại Công nghệ AI

Suy luận và triển khai

Quantization

Biểu diễn trọng số, activation hoặc cache bằng độ chính xác số thấp hơn. Nó giảm bộ nhớ, băng thông và chi phí tính toán, đổi lại là đánh đổi về độ chính xác và hỗ trợ phần cứng.

Giai đoạn tham chiếu
2015 / LLM PTQ 2022
Kiểm tra gần nhất

Thuật ngữ chính

  • precision
  • INT8
  • INT4
  • weight-only

Liên kết trong dự án

Nguồn sơ cấp

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.