稳妥可跑的模型
4K 上下文下,8GB 卡可稳定跑 7–8B 的 Q4_K_M。14B 需降至 Q3 且上下文 2K;32B+ 在 8GB 上不可行。
text
✓ Qwen2.5 7B Q4_K_M → ~7.4 GB @ 4K ctx
✓ Llama 3.1 8B Q4_K_M → ~7.7 GB @ 4K ctx
✓ Phi-4 Mini Q4_K_M → ~4.8 GB @ 4K ctx
△ DeepSeek-R1 14B Q3_K_M → ~9.5 GB @ 2K ctx (tight)
✗ Qwen2.5 32B any quant → needs 16GB+Ollama 快速上手
Ollama 会根据显存自动选择量化。先跑小模型验证速度,再尝试更大的。用 /api/ps 查看实时显存占用。
bash
ollama pull qwen2.5:7b
ollama run qwen2.5:7b
# Check loaded models and VRAM
curl http://localhost:11434/api/ps接下来
看看 🟢 RTX 4060 还能跑哪些模型反向查询 —— 8GB、4096 上下文,按质量排序本文涉及的模型
相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。