Tiếng Việt
← Quay lại Công nghệ AI

Suy luận và triển khai

Open-model Inference Ecosystem

Các engine và runtime như vLLM, llama.cpp biến trọng số tải xuống thành suy luận cục bộ hoặc trên máy chủ. Chúng ưu tiên khác nhau về thông lượng, tính di động phần cứng, định dạng và độ phức tạp vận hành.

Giai đoạn tham chiếu
2023–present
Kiểm tra gần nhất

Thuật ngữ chính

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

Liên kết trong dự án

Nguồn sơ cấp

  1. vLLM documentation
  2. llama.cpp

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.