Inferenza e distribuzione
Speculative Decoding
Un metodo di inferenza in cui un modello bozza più rapido propone più token e il modello target li verifica in parallelo. Può ridurre la latenza senza cambiare la distribuzione target.
Termini chiave
- draft model
- verification
- latency
- exact sampling
Collegamenti nel progetto
Si basa su
Usato da
Tecnologie correlate
Articoli correlati
Contesto storico
Fonti primarie
Questa è una mappa tecnica curata, non una pretesa di copertura completa.