入门端侧 / 本地 4 分钟阅读发布于 · 更新于

8GB 显卡入门指南:3060 / 4060 / 3070

最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。

面向的技术栈

Windows 或 Linux · NVIDIA 8GB(3060 8G / 3070 / 4060 / 4060 Ti 8G)· Ollama 或 llama.cpp CUDA · GGUF Q4_K_M · 16GB 系统内存

最近一次修改后未重新实机运行 —— 命令请当作起点,而不是已验证的配方。

8GB VRAMRTX 3060RTX 4060GGUFOllama

适用于谁

一张 8GB 的 NVIDIA 显卡(RTX 3060 8G、3070、4060、4060 Ti 8G),Windows 或 Linux,驱动正常,系统内存约 16GB。下面所有数字都是单路推理(batch 1)在标注上下文长度下的结果。命令以 Ollama 为例;llama.cpp 用法相同,不同之处会另行说明。

能装下什么,以及这些数字的含义

以下数字来自本站显存计算器的估算:按该量化档位实测的 bits-per-weight 计算权重,加上对应上下文的 KV 缓存,再加 10% 激活缓冲。它们不是实际文件大小,也不包含桌面本身已占用的显存 —— Windows 上通常是 0.5–1.5GB。这也是绿色区间到 88% 就截止、而不是 100% 的原因。4K 上下文下,8GB 显卡跑 7–8B 的 Q4_K_M 有实打实的余量;14B 在任何上下文下都装不进 Q4_K_M,因为光权重就超过整张卡。

text
Model                       Level    Context   Estimate   On 8GB
----------------------------------------------------------------------
Phi-4 Mini 3.8B             Q4_K_M   4K        3.0 GB     fits, large margin
Qwen3 4B                    Q6_K     4K        4.0 GB     fits
Gemma 4 E4B (image, audio)  Q4_K_M   4K        4.9 GB     fits
Qwen2.5 7B                  Q4_K_M   4K        5.1 GB     fits
Llama 3.1 8B                Q4_K_M   4K        5.6 GB     fits
Qwen3 8B                    Q4_K_M   4K        5.8 GB     fits
Qwen3-VL 8B (image)         Q4_K_M   4K        6.2 GB     fits
Llama 3.1 8B                Q4_K_M   16K       7.3 GB     tight — 91% of the card
Qwen3 14B                   Q4_K_M   2K        9.7 GB     over the card — see below
Qwen2.5 32B                 any      4K        21.7 GB    not on 8GB

“超出显卡容量”到底意味着什么

14B 的 Q4_K_M 约需 9.7GB,而显卡只有 8GB。这不是“勉强”,而是根本无法完整装入 GPU。两条现实路径:改用同一模型的 AWQ/GPTQ INT4 版本(索引给出约 8.1GB,仍高于宽裕区间)—— 注意提供这类服务的 vLLM 只支持 Linux(官方文档写明不原生支持 Windows),所以在 Windows 上要走 WSL2 —— 或者继续用 GGUF 并把一部分模型卸载到系统内存。部分卸载确实可行,Ollama 在装不下时默认就这么做,但留在 CPU 上的层每生成一个 token 都要经 PCIe 读取,吞吐会大幅下降 —— 具体降多少取决于你的 PCIe 带宽和内存速度,本指南没有在你的硬件上实测过。请为卸载出去的权重额外预留系统内存:上面这个 14B 的例子约 2GB,系统内存建议不低于 16GB。

bash
# llama.cpp now picks the split itself by default: with -ngl left unset it
# fits as many layers as it can while keeping 1 GiB of the card free
llama-server -m qwen3-14b-Q4_K_M.gguf -c 2048 --host 127.0.0.1

# Either way, the log line says what actually landed on the card:
#   load_tensors: offloaded N/M layers to GPU
# To choose yourself, pass -ngl (e.g. -ngl 28): fewer layers = less VRAM,
# slower generation.

Ollama 快速上手

Ollama 并不会根据你的显存自动挑选量化档位。直接 pull 一个裸标签,拿到的是该标签的默认构建 —— 大多数模型是 Q4_K_M —— 24GB 卡和 8GB 卡拿到的是同一个;想要别的档位必须在标签里写明。Ollama 真正会自动决定的是把多少层放到 GPU 上,而且当装不下时,它会静默退回到部分 CPU 卸载,而不是拒绝加载。

bash
# Default tag — Q4_K_M, regardless of your card
ollama pull qwen2.5:7b

# Ask for a level explicitly
ollama pull qwen2.5:7b-instruct-q5_K_M

ollama run qwen2.5:7b

确认它真的跑在 GPU 上

静默退回 CPU 卸载的模型照样能回答,只是很慢 —— 这正是“本地推理怎么这么卡”最常见的原因。两个检查点:`ollama ps` 会打印 PROCESSOR 一列,整模型都在显卡上时显示 100% GPU,否则会显示拆分比例(例如 70%/30% CPU/GPU);`nvidia-smi` 中应能看到一个占用量接近上面估算值的进程。只要 PROCESSOR 里出现 CPU 占比,就换更小的模型或更低的量化档位,不要将就。

bash
ollama ps
# NAME          ID     SIZE    PROCESSOR   UNTIL
# qwen2.5:7b    <id>   ...     100% GPU    4 minutes from now

nvidia-smi --query-compute-apps=pid,used_memory --format=csv

常见问题

加载时显存不足:多数情况是上下文而不是权重造成的 —— KV 缓存随上下文线性增长,8B 模型从 4K 提到 16K 大约要多占 1.7GB,占到 8GB 显卡的 91%。先降上下文。本该装得下却很慢:按上面的方法看 `ollama ps`;通常是显卡上还有别的东西(浏览器、游戏、上一个还驻留的模型),`ollama stop <模型>` 可以释放前一个。Windows 特别注意:桌面合成器占用的显存不会出现在模型自己的统计里,所以请把 88% 这条线当作真正的上限。

下一步

把你自己的显卡填进显存计算器,就能看到在你实际使用的上下文下完整的可运行列表 —— 上面的表格只是其中几行。如果你用 Windows,WSL2 + Ollama GPU 指南讲的是驱动直通,这才是多数 8GB 配置真正卡住的地方。

常见问题

8GB 显卡能跑 14B 模型吗?

没法完整放在显卡上。Qwen3 14B 的 Q4_K_M 即使在 2K 上下文下也要约 9.7GB,光权重就超过 8GB。把一部分模型卸载到系统内存还是能跑的 —— Ollama 和 llama.cpp 默认都会这么做 —— 但留在 CPU 上的层会拖慢每一个 token。AWQ INT4 版本约 8.1GB,仍然没给桌面留出余地。想让模型完整待在显卡上,就选 7–8B。

8GB 显卡上有哪些能看图的模型?

本索引里有两个在 4K 上下文下可以从容运行:Gemma 4 E4B 约 4.9GB,还支持音频输入;Qwen3-VL 8B 约 6.2GB。两者都是本站计算器给出的 Q4_K_M 估算。图像输入需要额外的视觉编码器,llama.cpp 会从单独的文件加载它,上面的数字不包含这部分,所以要留出一些余量。

8GB 显卡能撑多长的上下文?

对 Q4_K_M 的 8B 模型来说,大约到 16K 就会离开宽裕区间:Llama 3.1 8B 在 4K 时 5.6GB,16K 时 7.3GB,占显卡的 91% —— 偏紧,已经没有余量留给桌面。随上下文增长的只有 KV 缓存。降低量化档位能通过缩小权重给它腾出空间;换更小的模型不但同样缩小权重,每个 token 的缓存也更小,所以同样的显存能换来更长的窗口。

这篇指南用到了什么

接下来

看看 🟢 RTX 4060 还能跑哪些模型反向查询 —— 8GB、4096 上下文,按质量排序

本文涉及的模型

它真的跑起来了吗?

复制命令并不等于它能用,所以站内只在这里问一次。除了你的这个回答之外,不收集任何东西。

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。