ไทย
← กลับไปยังเทคโนโลยี AI

การอนุมานและการนำไปใช้

Quantization

การแทนน้ำหนัก ค่า activation หรือแคชด้วยความแม่นยำเชิงตัวเลขที่ต่ำลง ช่วยลดหน่วยความจำ แบนด์วิดท์ และการคำนวณ โดยต้องแลกกับความแม่นยำและการรองรับฮาร์ดแวร์

ช่วงเวลาอ้างอิง
2015 / LLM PTQ 2022
ตรวจล่าสุด

คำสำคัญ

  • precision
  • INT8
  • INT4
  • weight-only

ความเชื่อมโยงในโครงการ

แหล่งข้อมูลปฐมภูมิ

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด