入门端侧 / 本地 8 分钟阅读

8GB 显卡入门指南:3060 / 4060 / 3070

最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。

已验证技术栈

Ollama 0.6+ · llama.cpp CUDA · Qwen3-8B / R1-Distill-8B Q4_K_M

最近验证 2026-07-22

8GB VRAMRTX 3060RTX 4060GGUFOllama

稳妥可跑的模型

4K 上下文下,8GB 卡可稳定跑 7–8B 的 Q4_K_M。14B 需降至 Q3 且上下文 2K;32B+ 在 8GB 上不可行。

text
✓ Qwen2.5 7B Q4_K_M     → ~7.4 GB @ 4K ctx
✓ Llama 3.1 8B Q4_K_M    → ~7.7 GB @ 4K ctx
✓ Phi-4 Mini Q4_K_M        → ~4.8 GB @ 4K ctx
△ DeepSeek-R1 14B Q3_K_M  → ~9.5 GB @ 2K ctx (tight)
✗ Qwen2.5 32B any quant    → needs 16GB+

Ollama 快速上手

Ollama 会根据显存自动选择量化。先跑小模型验证速度,再尝试更大的。用 /api/ps 查看实时显存占用。

bash
ollama pull qwen2.5:7b
ollama run qwen2.5:7b

# Check loaded models and VRAM
curl http://localhost:11434/api/ps

接下来

看看 🟢 RTX 4060 还能跑哪些模型反向查询 —— 8GB、4096 上下文,按质量排序

本文涉及的模型

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。