Inférence et déploiement
Speculative Decoding
Une méthode d’inférence où un modèle brouillon plus rapide propose plusieurs jetons, vérifiés en parallèle par le modèle cible. Elle peut réduire la latence sans modifier la distribution cible.
Termes clés
- draft model
- verification
- latency
- exact sampling
Liens dans le projet
Repose sur
Utilisé par
Technologies liées
Contexte historique
Sources primaires
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.