Инференс и развёртывание
Speculative Decoding
Метод инференса, при котором быстрая черновая модель предлагает несколько токенов, а целевая модель проверяет их параллельно. Он снижает задержку без изменения целевого распределения.
Ключевые термины
- draft model
- verification
- latency
- exact sampling
Связи внутри проекта
Опирается на
Используется в
Связанные технологии
Исторический контекст
Первичные источники
Это отобранная техническая карта, а не заявление о полном охвате.