推論與部署 Quantization 以較低數值精度表示權重、啟用值或快取。它可以降低記憶體、頻寬與計算成本,但需權衡精度和硬體支援。 時間節點 2015 / LLM PTQ 2022 最近審查 2026-07-30 關鍵術語 precisionINT8INT4weight-only 專案內關聯 被用於 LoRA / QLoRAOpen-model Inference EcosystemMistral / MixtralGemma 相關技術 KV CacheDiffusion ModelContinuous Batching / PagedAttention 相關論文 深度壓縮:以剪枝、訓練中量化與霍夫曼編碼壓縮深度神經網路 (2016)GPTQ:面向生成式預訓練變換器的精確訓練後量化 (2023) 歷史背景 大模型時代 (2020年代—現在) 第一手來源 Deep CompressionGPTQTransformers quantization documentation 這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。