简体中文
← 返回 AI 技术体系

推理与部署

Quantization

以较低数值精度表示权重、激活值或缓存。它可以降低内存、带宽与计算成本,但需权衡精度和硬件支持。

时间节点
2015 / LLM PTQ 2022
最近审查

关键术语

  • precision
  • INT8
  • INT4
  • weight-only

项目内关联

一手来源

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。