推論與部署
Open-model Inference Ecosystem
vLLM、llama.cpp 等引擎與執行環境將可下載模型權重轉化為本機或伺服器端推論能力。它們在吞吐量、硬體可攜性、模型格式與維運複雜度上的側重不同。
關鍵術語
- vLLM
- llama.cpp
- GGUF
- local inference
專案內關聯
第一手來源
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。
推論與部署
vLLM、llama.cpp 等引擎與執行環境將可下載模型權重轉化為本機或伺服器端推論能力。它們在吞吐量、硬體可攜性、模型格式與維運複雜度上的側重不同。
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。