Bahasa Indonesia
← Kembali ke Teknologi AI

Inferensi dan penggelaran

Quantization

Merepresentasikan bobot, aktivasi, atau tembolok dengan presisi numerik yang lebih rendah. Cara ini dapat menurunkan biaya memori, lebar pita, dan komputasi, dengan pertukaran pada ketepatan dan dukungan perangkat keras.

Periode rujukan
2015 / LLM PTQ 2022
Terakhir ditinjau

Istilah kunci

  • precision
  • INT8
  • INT4
  • weight-only

Terhubung di seluruh proyek

Sumber primer

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.