Русский
← Назад к технологиям ИИ

Инференс и развёртывание

Quantization

Представление весов, активаций или кэшей с пониженной числовой точностью. Оно сокращает память, пропускную способность и вычисления, но требует компромисса с точностью и поддержкой оборудования.

Опорный период
2015 / LLM PTQ 2022
Последняя проверка

Ключевые термины

  • precision
  • INT8
  • INT4
  • weight-only

Связи внутри проекта

Первичные источники

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Это отобранная техническая карта, а не заявление о полном охвате.