Inferenza e distribuzione
Open-model Inference Ecosystem
Motori e runtime come vLLM e llama.cpp trasformano pesi scaricabili in inferenza locale o server. Le priorità variano tra throughput, portabilità hardware, formati e complessità operativa.
Termini chiave
- vLLM
- llama.cpp
- GGUF
- local inference
Collegamenti nel progetto
Tecnologie correlate
Contesto storico
Sezioni correlate
Fonti primarie
Questa è una mappa tecnica curata, non una pretesa di copertura completa.