日本語
← AI 技術体系に戻る

推論と配備

Open-model Inference Ecosystem

vLLM や llama.cpp などのエンジンとランタイムは、取得可能なモデル重みをローカルまたはサーバー推論へつなぎます。スループット、ハードウェア移植性、形式、運用複雑性の重点は異なります。

基準時期
2023–present
最終確認

主要用語

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

プロジェクト内のつながり

一次資料

  1. vLLM documentation
  2. llama.cpp

これは選定された技術マップであり、網羅性を主張するものではありません。