Italiano
← Torna alle tecnologie dell’IA

Inferenza e distribuzione

Quantization

La rappresentazione di pesi, attivazioni o cache con precisione numerica inferiore. Riduce memoria, banda e calcolo, con compromessi di accuratezza e supporto hardware.

Periodo di riferimento
2015 / LLM PTQ 2022
Ultima verifica

Termini chiave

  • precision
  • INT8
  • INT4
  • weight-only

Collegamenti nel progetto

Fonti primarie

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Questa è una mappa tecnica curata, non una pretesa di copertura completa.