Инференс и развёртывание
Open-model Inference Ecosystem
Движки и среды выполнения, такие как vLLM и llama.cpp, превращают доступные веса в локальный или серверный инференс. Их приоритеты различаются по пропускной способности, переносимости, форматам и сложности эксплуатации.
Ключевые термины
- vLLM
- llama.cpp
- GGUF
- local inference
Связи внутри проекта
Связанные технологии
Исторический контекст
Связанные разделы
Первичные источники
Это отобранная техническая карта, а не заявление о полном охвате.