Português
← Voltar às tecnologias de IA

Inferência e implantação

Quantization

A representação de pesos, ativações ou caches com menor precisão numérica. Reduz memória, largura de banda e computação, com compromissos de precisão e suporte de hardware.

Período de referência
2015 / LLM PTQ 2022
Última revisão

Termos-chave

  • precision
  • INT8
  • INT4
  • weight-only

Ligações no projeto

Fontes primárias

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.