Tiếng Việt
← Quay lại Công nghệ AI

Suy luận và triển khai

Speculative Decoding

Phương pháp suy luận trong đó mô hình nháp nhanh hơn đề xuất nhiều token và mô hình đích kiểm tra song song. Nó có thể giảm độ trễ mà không đổi phân phối đích.

Giai đoạn tham chiếu
2022
Kiểm tra gần nhất

Thuật ngữ chính

  • draft model
  • verification
  • latency
  • exact sampling

Liên kết trong dự án

Nguồn sơ cấp

  1. Fast Inference from Transformers via Speculative Decoding

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.