Русский
← Назад к технологиям ИИ

Инференс и развёртывание

Speculative Decoding

Метод инференса, при котором быстрая черновая модель предлагает несколько токенов, а целевая модель проверяет их параллельно. Он снижает задержку без изменения целевого распределения.

Опорный период
2022
Последняя проверка

Ключевые термины

  • draft model
  • verification
  • latency
  • exact sampling

Связи внутри проекта

Первичные источники

  1. Fast Inference from Transformers via Speculative Decoding

Это отобранная техническая карта, а не заявление о полном охвате.