Inferenz und Bereitstellung
Speculative Decoding
Ein Inferenzverfahren, bei dem ein schnelleres Entwurfsmodell mehrere Tokens vorschlägt und das Zielmodell sie parallel prüft. Es kann die Latenz senken, ohne die Zielverteilung zu verändern.
Schlüsselbegriffe
- draft model
- verification
- latency
- exact sampling
Verknüpfungen im Projekt
Baut auf
Verwendet von
Verwandte Technologien
Verwandte Arbeiten
Historischer Kontext
Primärquellen
Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.