线程数
-t 设为物理核心数(非超线程)。单 batch 交互用 -tb 1。
bash
./build/bin/llama-server \
-m ./models/Llama-3.1-8B-Q4_K_M.gguf \
-t 8 -tb 1 -c 4096 \
--host 0.0.0.0 --port 8080预期性能
8 核 VPS + OpenBLAS 在 8B Q4_K_M 上约 8–15 tok/s,适合个人 API,不适合生产吞吐。
text
Hetzner CX32 (8 vCPU, 32GB): ~12 tok/s
AWS c7i.2xlarge (8 vCPU): ~15 tok/s相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。