Inferencia y despliegue
Speculative Decoding
Un método de inferencia en el que un modelo borrador más rápido propone varios tokens y el modelo objetivo los verifica en paralelo. Puede reducir latencia sin cambiar la distribución objetivo.
Términos clave
- draft model
- verification
- latency
- exact sampling
Conexiones en el proyecto
Se basa en
Usado por
Tecnologías relacionadas
Artículos relacionados
Contexto histórico
Fuentes primarias
Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.