Português
← Voltar às tecnologias de IA

Inferência e implantação

Speculative Decoding

Um método de inferência em que um modelo de rascunho mais rápido propõe vários tokens e o modelo-alvo os verifica em paralelo. Pode reduzir latência sem alterar a distribuição-alvo.

Período de referência
2022
Última revisão

Termos-chave

  • draft model
  • verification
  • latency
  • exact sampling

Ligações no projeto

Fontes primárias

  1. Fast Inference from Transformers via Speculative Decoding

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.