简体中文
← 返回 AI 技术体系

推理与部署

Open-model Inference Ecosystem

vLLM、llama.cpp 等引擎与运行时将可下载模型权重转化为本地或服务端推理能力。它们在吞吐量、硬件可移植性、模型格式与运维复杂度上的侧重点不同。

时间节点
2023–present
最近审查

关键术语

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

项目内关联

一手来源

  1. vLLM documentation
  2. llama.cpp

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。