Deutsch
← Zurück zu KI-Technologien

Inferenz und Bereitstellung

Quantization

Die Darstellung von Gewichten, Aktivierungen oder Caches mit geringerer numerischer Genauigkeit. Sie reduziert Speicher-, Bandbreiten- und Rechenkosten, erfordert aber Genauigkeits- und Hardwareabwägungen.

Referenzzeitraum
2015 / LLM PTQ 2022
Zuletzt geprüft

Schlüsselbegriffe

  • precision
  • INT8
  • INT4
  • weight-only

Verknüpfungen im Projekt

Primärquellen

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.