适用于谁
一张 8GB 的 NVIDIA 显卡(RTX 3060 8G、3070、4060、4060 Ti 8G),Windows 或 Linux,驱动正常,系统内存约 16GB。下面所有数字都是单路推理(batch 1)在标注上下文长度下的结果。命令以 Ollama 为例;llama.cpp 用法相同,不同之处会另行说明。
能装下什么,以及这些数字的含义
以下数字来自本站显存计算器的估算:按该量化档位实测的 bits-per-weight 计算权重,加上对应上下文的 KV 缓存,再加 10% 激活缓冲。它们不是实际文件大小,也不包含桌面本身已占用的显存 —— Windows 上通常是 0.5–1.5GB。这也是绿色区间到 88% 就截止、而不是 100% 的原因。4K 上下文下,8GB 显卡跑 7–8B 的 Q4_K_M 有实打实的余量;14B 在任何上下文下都装不进 Q4_K_M,因为光权重就超过整张卡。
Model Level Context Estimate On 8GB
----------------------------------------------------------------------
Phi-4 Mini 3.8B Q4_K_M 4K 3.0 GB fits, large margin
Qwen3 4B Q6_K 4K 4.0 GB fits
Gemma 4 E4B (image, audio) Q4_K_M 4K 4.9 GB fits
Qwen2.5 7B Q4_K_M 4K 5.1 GB fits
Llama 3.1 8B Q4_K_M 4K 5.6 GB fits
Qwen3 8B Q4_K_M 4K 5.8 GB fits
Qwen3-VL 8B (image) Q4_K_M 4K 6.2 GB fits
Llama 3.1 8B Q4_K_M 16K 7.3 GB tight — 91% of the card
Qwen3 14B Q4_K_M 2K 9.7 GB over the card — see below
Qwen2.5 32B any 4K 21.7 GB not on 8GB“超出显卡容量”到底意味着什么
14B 的 Q4_K_M 约需 9.7GB,而显卡只有 8GB。这不是“勉强”,而是根本无法完整装入 GPU。两条现实路径:改用同一模型的 AWQ/GPTQ INT4 版本(索引给出约 8.1GB,仍高于宽裕区间)—— 注意提供这类服务的 vLLM 只支持 Linux(官方文档写明不原生支持 Windows),所以在 Windows 上要走 WSL2 —— 或者继续用 GGUF 并把一部分模型卸载到系统内存。部分卸载确实可行,Ollama 在装不下时默认就这么做,但留在 CPU 上的层每生成一个 token 都要经 PCIe 读取,吞吐会大幅下降 —— 具体降多少取决于你的 PCIe 带宽和内存速度,本指南没有在你的硬件上实测过。请为卸载出去的权重额外预留系统内存:上面这个 14B 的例子约 2GB,系统内存建议不低于 16GB。
# llama.cpp now picks the split itself by default: with -ngl left unset it
# fits as many layers as it can while keeping 1 GiB of the card free
llama-server -m qwen3-14b-Q4_K_M.gguf -c 2048 --host 127.0.0.1
# Either way, the log line says what actually landed on the card:
# load_tensors: offloaded N/M layers to GPU
# To choose yourself, pass -ngl (e.g. -ngl 28): fewer layers = less VRAM,
# slower generation.Ollama 快速上手
Ollama 并不会根据你的显存自动挑选量化档位。直接 pull 一个裸标签,拿到的是该标签的默认构建 —— 大多数模型是 Q4_K_M —— 24GB 卡和 8GB 卡拿到的是同一个;想要别的档位必须在标签里写明。Ollama 真正会自动决定的是把多少层放到 GPU 上,而且当装不下时,它会静默退回到部分 CPU 卸载,而不是拒绝加载。
# Default tag — Q4_K_M, regardless of your card
ollama pull qwen2.5:7b
# Ask for a level explicitly
ollama pull qwen2.5:7b-instruct-q5_K_M
ollama run qwen2.5:7b确认它真的跑在 GPU 上
静默退回 CPU 卸载的模型照样能回答,只是很慢 —— 这正是“本地推理怎么这么卡”最常见的原因。两个检查点:`ollama ps` 会打印 PROCESSOR 一列,整模型都在显卡上时显示 100% GPU,否则会显示拆分比例(例如 70%/30% CPU/GPU);`nvidia-smi` 中应能看到一个占用量接近上面估算值的进程。只要 PROCESSOR 里出现 CPU 占比,就换更小的模型或更低的量化档位,不要将就。
ollama ps
# NAME ID SIZE PROCESSOR UNTIL
# qwen2.5:7b <id> ... 100% GPU 4 minutes from now
nvidia-smi --query-compute-apps=pid,used_memory --format=csv常见问题
加载时显存不足:多数情况是上下文而不是权重造成的 —— KV 缓存随上下文线性增长,8B 模型从 4K 提到 16K 大约要多占 1.7GB,占到 8GB 显卡的 91%。先降上下文。本该装得下却很慢:按上面的方法看 `ollama ps`;通常是显卡上还有别的东西(浏览器、游戏、上一个还驻留的模型),`ollama stop <模型>` 可以释放前一个。Windows 特别注意:桌面合成器占用的显存不会出现在模型自己的统计里,所以请把 88% 这条线当作真正的上限。
下一步
把你自己的显卡填进显存计算器,就能看到在你实际使用的上下文下完整的可运行列表 —— 上面的表格只是其中几行。如果你用 Windows,WSL2 + Ollama GPU 指南讲的是驱动直通,这才是多数 8GB 配置真正卡住的地方。
常见问题
8GB 显卡能跑 14B 模型吗?
没法完整放在显卡上。Qwen3 14B 的 Q4_K_M 即使在 2K 上下文下也要约 9.7GB,光权重就超过 8GB。把一部分模型卸载到系统内存还是能跑的 —— Ollama 和 llama.cpp 默认都会这么做 —— 但留在 CPU 上的层会拖慢每一个 token。AWQ INT4 版本约 8.1GB,仍然没给桌面留出余地。想让模型完整待在显卡上,就选 7–8B。
8GB 显卡上有哪些能看图的模型?
本索引里有两个在 4K 上下文下可以从容运行:Gemma 4 E4B 约 4.9GB,还支持音频输入;Qwen3-VL 8B 约 6.2GB。两者都是本站计算器给出的 Q4_K_M 估算。图像输入需要额外的视觉编码器,llama.cpp 会从单独的文件加载它,上面的数字不包含这部分,所以要留出一些余量。
8GB 显卡能撑多长的上下文?
对 Q4_K_M 的 8B 模型来说,大约到 16K 就会离开宽裕区间:Llama 3.1 8B 在 4K 时 5.6GB,16K 时 7.3GB,占显卡的 91% —— 偏紧,已经没有余量留给桌面。随上下文增长的只有 KV 缓存。降低量化档位能通过缩小权重给它腾出空间;换更小的模型不但同样缩小权重,每个 token 的缓存也更小,所以同样的显存能换来更长的窗口。
这篇指南用到了什么
接下来
看看 🟢 RTX 4060 还能跑哪些模型反向查询 —— 8GB、4096 上下文,按质量排序本文涉及的模型
它真的跑起来了吗?
复制命令并不等于它能用,所以站内只在这里问一次。除了你的这个回答之外,不收集任何东西。
相关指南
12GB 显卡能跑什么(RTX 3060 12G、4070、5070)
12GB NVIDIA 显卡在 8K–32K 上下文下能装下哪些模型、14B 从哪里开始装不下、如何用 Ollama 或 llama.cpp 运行,以及如何确认确实跑在 GPU 上。
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
Intel Arc 显卡:llama.cpp(SYCL)或 Ollama(Vulkan)
在 Arc B580、B570、A770、A750 上跑 GGUF —— SYCL 编译、Ollama 路线、如何确认真的在用 GPU,以及 8–16 GB 能装下什么。