Inferensi dan penggelaran
Open-model Inference Ecosystem
Mesin dan runtime seperti vLLM dan llama.cpp mengubah bobot model yang dapat diunduh menjadi inferensi lokal atau di server. Prioritas keduanya berbeda pada keluaran, keterbawaan perangkat keras, format model, dan kerumitan operasional.
Istilah kunci
- vLLM
- llama.cpp
- GGUF
- local inference
Terhubung di seluruh proyek
Dibangun di atas
Teknologi terkait
Konteks sejarah
Bagian terkait
Sumber primer
Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.