Suy luận và triển khai
Open-model Inference Ecosystem
Các engine và runtime như vLLM, llama.cpp biến trọng số tải xuống thành suy luận cục bộ hoặc trên máy chủ. Chúng ưu tiên khác nhau về thông lượng, tính di động phần cứng, định dạng và độ phức tạp vận hành.
Thuật ngữ chính
- vLLM
- llama.cpp
- GGUF
- local inference
Liên kết trong dự án
Công nghệ liên quan
Bối cảnh lịch sử
Phần liên quan
Nguồn sơ cấp
Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.