การอนุมานและการนำไปใช้
Open-model Inference Ecosystem
เอนจินและรันไทม์ เช่น vLLM และ llama.cpp เปลี่ยนน้ำหนักโมเดลที่ดาวน์โหลดได้เป็นการอนุมานในเครื่องหรือบนเซิร์ฟเวอร์ โดยให้ความสำคัญต่างกันด้าน throughput การรองรับฮาร์ดแวร์ รูปแบบ และความซับซ้อนในการดูแล
คำสำคัญ
- vLLM
- llama.cpp
- GGUF
- local inference
ความเชื่อมโยงในโครงการ
เทคโนโลยีที่เกี่ยวข้อง
บริบททางประวัติศาสตร์
ส่วนที่เกี่ยวข้อง
แหล่งข้อมูลปฐมภูมิ
นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด