Português
← Voltar às tecnologias de IA

Inferência e implantação

Open-model Inference Ecosystem

Motores e runtimes como vLLM e llama.cpp transformam pesos transferíveis em inferência local ou em servidor. As prioridades variam entre débito, portabilidade de hardware, formatos e complexidade operacional.

Período de referência
2023–present
Última revisão

Termos-chave

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

Ligações no projeto

Fontes primárias

  1. vLLM documentation
  2. llama.cpp

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.