进阶端侧 / 本地 8 分钟阅读

单卡 RTX 4090 运行 Qwen2.5-Coder 32B

24GB 能装下的最佳开源代码模型 — 量化选择与调优技巧。

已验证技术栈

RTX 4090 24G · Qwen2.5-Coder 32B Q4_K_M · llama.cpp -ngl 99 · 4K 上下文

最近验证 2026-07-22

Qwen2.5-Coder32BRTX 4090GGUF

量化选择

Q4_K_M 权重约 22GB。如需 8K+ 上下文,降至 Q3_K_M 或 EXL2 3.5bpw。

text
Q4_K_M: best quality, ~22 GB weights
Q3_K_M: saves ~4 GB, acceptable for code
EXL2 3.5bpw: fastest, ~16 GB weights

推荐命令

llama.cpp 全 GPU 卸载 + 4K 上下文是最佳平衡点。

bash
./build/bin/llama-server \
  -m ./models/Qwen2.5-Coder-32B-Q4_K_M.gguf \
  -ngl 99 -c 4096 --host 0.0.0.0 --port 8080

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。