进阶服务器 / VPS 7 分钟阅读

CPU 推理:llama.cpp OpenBLAS 调优

在纯 CPU VPS 上通过线程数和 BLAS 后端调优最大化 tok/s。

已验证技术栈

纯 CPU VPS · llama.cpp OpenBLAS · -t 物理核心数 · 8B Q4_K_M

最近验证 2026-07-22

CPUllama.cppOpenBLASVPS

线程数

-t 设为物理核心数(非超线程)。单 batch 交互用 -tb 1。

bash
./build/bin/llama-server \
  -m ./models/Llama-3.1-8B-Q4_K_M.gguf \
  -t 8 -tb 1 -c 4096 \
  --host 0.0.0.0 --port 8080

预期性能

8 核 VPS + OpenBLAS 在 8B Q4_K_M 上约 8–15 tok/s,适合个人 API,不适合生产吞吐。

text
Hetzner CX32 (8 vCPU, 32GB): ~12 tok/s
AWS c7i.2xlarge (8 vCPU): ~15 tok/s

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。