量化选择
Q4_K_M 权重约 22GB。如需 8K+ 上下文,降至 Q3_K_M 或 EXL2 3.5bpw。
text
Q4_K_M: best quality, ~22 GB weights
Q3_K_M: saves ~4 GB, acceptable for code
EXL2 3.5bpw: fastest, ~16 GB weights推荐命令
llama.cpp 全 GPU 卸载 + 4K 上下文是最佳平衡点。
bash
./build/bin/llama-server \
-m ./models/Qwen2.5-Coder-32B-Q4_K_M.gguf \
-ngl 99 -c 4096 --host 0.0.0.0 --port 8080相关指南
进阶端侧 / 本地9 分钟阅读
DeepSeek-R1 Distill 14B:EXL2 vs GGUF 对比
RTX 4090 实测对比 — 何时选 turboderp EXL2 而非 bartowski GGUF。
进阶端侧 / 本地10 分钟阅读
RTX 4090 上 ExLlamaV2 完整配置
10 分钟内安装 ExLlamaV2、加载 EXL2 量化并提供 OpenAI 兼容 API。
进阶端侧 / 本地9 分钟阅读
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。