Français
← Retour aux technologies de l’IA

Inférence et déploiement

Open-model Inference Ecosystem

Des moteurs comme vLLM et llama.cpp transforment des poids téléchargeables en inférence locale ou serveur. Leurs priorités diffèrent entre débit, portabilité matérielle, formats et complexité opérationnelle.

Période de référence
2023–present
Dernière vérification

Termes clés

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

Liens dans le projet

Sources primaires

  1. vLLM documentation
  2. llama.cpp

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.