Deutsch
← Zurück zu KI-Technologien

Inferenz und Bereitstellung

Open-model Inference Ecosystem

Engines und Laufzeiten wie vLLM und llama.cpp machen herunterladbare Modellgewichte lokal oder auf Servern nutzbar. Sie gewichten Durchsatz, Hardwareportabilität, Formate und Betriebsaufwand unterschiedlich.

Referenzzeitraum
2023–present
Zuletzt geprüft

Schlüsselbegriffe

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

Verknüpfungen im Projekt

Primärquellen

  1. vLLM documentation
  2. llama.cpp

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.