Inferência e implantação
Open-model Inference Ecosystem
Motores e runtimes como vLLM e llama.cpp transformam pesos transferíveis em inferência local ou em servidor. As prioridades variam entre débito, portabilidade de hardware, formatos e complexidade operacional.
Termos-chave
- vLLM
- llama.cpp
- GGUF
- local inference
Ligações no projeto
Tecnologias relacionadas
Contexto histórico
Secções relacionadas
Fontes primárias
Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.