推理与部署 Quantization 以较低数值精度表示权重、激活值或缓存。它可以降低内存、带宽与计算成本,但需权衡精度和硬件支持。 时间节点 2015 / LLM PTQ 2022 最近审查 2026-07-30 关键术语 precisionINT8INT4weight-only 项目内关联 被用于 LoRA / QLoRAOpen-model Inference EcosystemMistral / MixtralGemma 相关技术 KV CacheDiffusion ModelContinuous Batching / PagedAttention 相关论文 深度压缩:以剪枝、训练中量化与哈夫曼编码压缩深度神经网络 (2016)GPTQ:面向生成式预训练变换器的精确训练后量化 (2023) 历史背景 大模型时代 (2020年代—现在) 一手来源 Deep CompressionGPTQTransformers quantization documentation 这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。