한국어
← AI 기술 체계로 돌아가기

추론과 배포

Quantization

가중치, 활성값 또는 캐시를 낮은 수치 정밀도로 표현하는 기술이다. 메모리, 대역폭, 연산 비용을 줄이지만 정확도와 하드웨어 지원의 절충이 있다.

기준 시기
2015 / LLM PTQ 2022
최근 검토

핵심 용어

  • precision
  • INT8
  • INT4
  • weight-only

프로젝트 내 연결

1차 출처

  1. Deep Compression
  2. GPTQ
  3. Transformers quantization documentation

선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.