한국어
← AI 기술 체계로 돌아가기

추론과 배포

Open-model Inference Ecosystem

vLLM과 llama.cpp 같은 엔진 및 런타임은 내려받은 모델 가중치를 로컬 또는 서버 추론으로 연결한다. 처리량, 하드웨어 이식성, 형식, 운영 복잡성에서 우선순위가 다르다.

기준 시기
2023–present
최근 검토

핵심 용어

  • vLLM
  • llama.cpp
  • GGUF
  • local inference

프로젝트 내 연결

1차 출처

  1. vLLM documentation
  2. llama.cpp

선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.