Italiano
← Torna alle tecnologie dell’IA

Inferenza e distribuzione

Open-model Inference Ecosystem

Motori e runtime come vLLM e llama.cpp trasformano pesi scaricabili in inferenza locale o server. Le priorità variano tra throughput, portabilità hardware, formati e complessità operativa.

Periodo di riferimento
2023–present
Ultima verifica

Termini chiave

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

Collegamenti nel progetto

Fonti primarie

  1. vLLM documentation
  2. llama.cpp

Questa è una mappa tecnica curata, non una pretesa di copertura completa.