추론과 배포
Open-model Inference Ecosystem
vLLM과 llama.cpp 같은 엔진 및 런타임은 내려받은 모델 가중치를 로컬 또는 서버 추론으로 연결한다. 처리량, 하드웨어 이식성, 형식, 운영 복잡성에서 우선순위가 다르다.
핵심 용어
- vLLM
- llama.cpp
- GGUF
- local inference
프로젝트 내 연결
1차 출처
선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.
추론과 배포
vLLM과 llama.cpp 같은 엔진 및 런타임은 내려받은 모델 가중치를 로컬 또는 서버 추론으로 연결한다. 처리량, 하드웨어 이식성, 형식, 운영 복잡성에서 우선순위가 다르다.
선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.