Español
← Volver a Tecnologías de IA

Inferencia y despliegue

Quantization

La representación de pesos, activaciones o cachés con menor precisión numérica. Reduce memoria, ancho de banda y cómputo, con compromisos de precisión y compatibilidad de hardware.

Periodo de referencia
2015 / LLM PTQ 2022
Última revisión

Términos clave

  • precision
  • INT8
  • INT4
  • weight-only

Conexiones en el proyecto

Fuentes primarias

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.