हिन्दी
← AI प्रौद्योगिकी पर लौटें

अनुमान और तैनाती

Quantization

भार, सक्रियण या तमोगत संचय को कम संख्यात्मक परिशुद्धता में निरूपित करना। इससे स्मृति, बैंडविड्थ और संगणना की लागत घट सकती है, पर शुद्धता और हार्डवेयर-समर्थन के समझौते रहते हैं।

संदर्भ अवधि
2015 / LLM PTQ 2022
अंतिम समीक्षा

मुख्य शब्द

  • precision
  • INT8
  • INT4
  • weight-only

पूरी परियोजना में जुड़ाव

प्राथमिक स्रोत

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

यह एक चुना हुआ तकनीकी मानचित्र है, सम्पूर्ण कवरेज का दावा नहीं।