Inferência e implantação
Speculative Decoding
Um método de inferência em que um modelo de rascunho mais rápido propõe vários tokens e o modelo-alvo os verifica em paralelo. Pode reduzir latência sem alterar a distribuição-alvo.
Termos-chave
- draft model
- verification
- latency
- exact sampling
Ligações no projeto
Assenta em
Usado por
Tecnologias relacionadas
Artigos relacionados
Contexto histórico
Fontes primárias
Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.