Español
← Volver a Tecnologías de IA

Inferencia y despliegue

Speculative Decoding

Un método de inferencia en el que un modelo borrador más rápido propone varios tokens y el modelo objetivo los verifica en paralelo. Puede reducir latencia sin cambiar la distribución objetivo.

Periodo de referencia
2022
Última revisión

Términos clave

  • draft model
  • verification
  • latency
  • exact sampling

Conexiones en el proyecto

Fuentes primarias

  1. Fast Inference from Transformers via Speculative Decoding

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.