한국어
← AI 기술 체계로 돌아가기

추론과 배포

Speculative Decoding

더 빠른 초안 모델이 여러 토큰을 제안하고 대상 모델이 병렬로 검증하는 추론 기법이다. 대상 분포를 바꾸지 않고 생성 지연을 줄일 수 있다.

기준 시기
2022
최근 검토

핵심 용어

  • draft model
  • verification
  • latency
  • exact sampling

프로젝트 내 연결

1차 출처

  1. Fast Inference from Transformers via Speculative Decoding

선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.