Italiano
← Torna alle tecnologie dell’IA

Inferenza e distribuzione

Speculative Decoding

Un metodo di inferenza in cui un modello bozza più rapido propone più token e il modello target li verifica in parallelo. Può ridurre la latenza senza cambiare la distribuzione target.

Periodo di riferimento
2022
Ultima verifica

Termini chiave

  • draft model
  • verification
  • latency
  • exact sampling

Collegamenti nel progetto

Fonti primarie

  1. Fast Inference from Transformers via Speculative Decoding

Questa è una mappa tecnica curata, non una pretesa di copertura completa.