繁體中文
← 返回 AI 技術體系

推論與部署

Quantization

以較低數值精度表示權重、啟用值或快取。它可以降低記憶體、頻寬與計算成本,但需權衡精度和硬體支援。

時間節點
2015 / LLM PTQ 2022
最近審查

關鍵術語

  • precision
  • INT8
  • INT4
  • weight-only

專案內關聯

第一手來源

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。