Inférence et déploiement
Open-model Inference Ecosystem
Des moteurs comme vLLM et llama.cpp transforment des poids téléchargeables en inférence locale ou serveur. Leurs priorités diffèrent entre débit, portabilité matérielle, formats et complexité opérationnelle.
Termes clés
- vLLM
- llama.cpp
- GGUF
- local inference
Liens dans le projet
Technologies liées
Contexte historique
Rubriques liées
Sources primaires
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.