推理与部署
Open-model Inference Ecosystem
vLLM、llama.cpp 等引擎与运行时将可下载模型权重转化为本地或服务端推理能力。它们在吞吐量、硬件可移植性、模型格式与运维复杂度上的侧重点不同。
关键术语
- vLLM
- llama.cpp
- GGUF
- local inference
项目内关联
一手来源
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。
推理与部署
vLLM、llama.cpp 等引擎与运行时将可下载模型权重转化为本地或服务端推理能力。它们在吞吐量、硬件可移植性、模型格式与运维复杂度上的侧重点不同。
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。