Français
← Retour aux technologies de l’IA

Inférence et déploiement

Speculative Decoding

Une méthode d’inférence où un modèle brouillon plus rapide propose plusieurs jetons, vérifiés en parallèle par le modèle cible. Elle peut réduire la latence sans modifier la distribution cible.

Période de référence
2022
Dernière vérification

Termes clés

  • draft model
  • verification
  • latency
  • exact sampling

Liens dans le projet

Sources primaires

  1. Fast Inference from Transformers via Speculative Decoding

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.