Deutsch
← Zurück zu KI-Technologien

Inferenz und Bereitstellung

Speculative Decoding

Ein Inferenzverfahren, bei dem ein schnelleres Entwurfsmodell mehrere Tokens vorschlägt und das Zielmodell sie parallel prüft. Es kann die Latenz senken, ohne die Zielverteilung zu verändern.

Referenzzeitraum
2022
Zuletzt geprüft

Schlüsselbegriffe

  • draft model
  • verification
  • latency
  • exact sampling

Verknüpfungen im Projekt

Primärquellen

  1. Fast Inference from Transformers via Speculative Decoding

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.