Inferenz und Bereitstellung
Open-model Inference Ecosystem
Engines und Laufzeiten wie vLLM und llama.cpp machen herunterladbare Modellgewichte lokal oder auf Servern nutzbar. Sie gewichten Durchsatz, Hardwareportabilität, Formate und Betriebsaufwand unterschiedlich.
Schlüsselbegriffe
- vLLM
- llama.cpp
- GGUF
- local inference
Verknüpfungen im Projekt
Verwandte Technologien
Historischer Kontext
Verwandte Bereiche
Primärquellen
Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.