入门端侧 / 本地 4 分钟阅读发布于

12GB 显卡能跑什么(RTX 3060 12G、4070、5070)

12GB NVIDIA 显卡在 8K–32K 上下文下能装下哪些模型、14B 从哪里开始装不下、如何用 Ollama 或 llama.cpp 运行,以及如何确认确实跑在 GPU 上。

面向的技术栈

Windows 或 Linux · 带 CUDA 的 NVIDIA 驱动 · Ollama,或以 GGML_CUDA=ON 编译的 llama.cpp · GGUF Q4_K_M

最近一次修改后未重新实机运行 —— 命令请当作起点,而不是已验证的配方。

12GBRTX 3060RTX 4070RTX 5070Ollamallama.cppGGUF

适用于哪些显卡

本索引里有七张 12GB 的 NVIDIA 卡:RTX 3060 12G、RTX 4070、4070 Super、4070 Ti、RTX 5070,以及 RTX 3080 12G 和 3080 Ti。它们能装下的模型完全一样 —— 决定能否装下的只有容量 —— 但跑起来速度不同,因为生成 token 的速度受显存带宽限制,而带宽从 3060 的 360 GB/s 到 3080 的 912 GB/s 不等。12GB 的 Radeon 或 Arc B580 能装下的模型清单也相同,它们的运行时请看 AMD 和 Intel Arc 指南。

text
Card            Bandwidth   ceiling for Qwen3 8B Q4_K_M
RTX 3060 12G    360 GB/s    76 tok/s
RTX 4070 / Super / Ti   504 GB/s    107 tok/s
RTX 5070        672 GB/s    142 tok/s
RTX 3080 12G / Ti       912 GB/s    193 tok/s

Ceilings = bandwidth ÷ weight file size. Not measured here; real speed is lower.

能装下什么,以及 14B 从哪里开始装不下

本索引 89 个模型中,有 48 个能在 4K 上下文下宽裕地装进 12GB 显卡,能加载的共 50 个。7B–12B 是宽裕区间,其余取决于上下文长度。Gemma 3 12B 在 Q4_K_M、32K 上下文下约 10.4 GB,仍然宽裕,因为它大部分层只用很短的滑动窗口。Mistral Nemo 12B 在 Q4_K_M、32K 上下文下约 13.2 GB,装不下。14B 是边界:Qwen3 14B 在 Q4_K_M、4K 上下文下约 10.0 GB,宽裕;但在 8K 上下文下约 10.7 GB —— 占显卡 89%,超过了本站的宽裕线 —— 到 16K 就装不下了。

text
GGUF Q4_K_M            8K        16K       32K
Llama 3.1 8B           6.2 GB    7.3 GB    9.5 GB
Qwen3 8B               6.4 GB    7.7 GB    10.1 GB
Gemma 3 12B            8.8 GB    9.3 GB    10.4 GB
Mistral Nemo 12B       9.1 GB    10.5 GB   13.2 GB  ✗
Qwen3 14B              10.7 GB ~ 12.1 GB ✗ 14.9 GB ✗
Phi-4 14B              11.0 GB ~ 12.8 GB ✗ (16K max)

~ = tight (88–105% of the card)   ✗ = does not fit

用 Ollama 运行

Windows 或 Linux 上最短的路是 Ollama。直接从 Hugging Face 的 GGUF 仓库拉取可以固定具体的量化档位,这一点在这里很关键:12B 模型用 Q4_K_M 还是 Q8_0,就是装得下和装不下的区别。Ollama 有自己的默认上下文长度;需要更长时在会话里调大,调之前先对照上面的表。

bash
ollama run hf.co/Qwen/Qwen3-8B-GGUF:Q4_K_M

# inside the session, for a longer context:
/set parameter num_ctx 16384

ollama ps          # PROCESSOR should read 100% GPU

或者用 llama.cpp 运行

用 llama.cpp 时,传 -ngl all 和明确的 -c。新版本会自动按显卡容量调整,并保留约 1 GiB 空闲,所以接近上限的模型会悄悄把部分层留在 CPU 上;明确要求全部层上 GPU,能让装不下的模型直接报错,而不是慢吞吞地跑。除非你确实要对局域网提供服务,否则绑定 127.0.0.1。

bash
pip install -U huggingface_hub
hf download Qwen/Qwen3-8B-GGUF --include "Qwen3-8B-Q4_K_M.gguf" --local-dir ./models

./build/bin/llama-server -m ./models/Qwen3-8B-Q4_K_M.gguf \
  -ngl all -c 16384 --host 127.0.0.1 --port 8080

# startup log:  load_tensors: offloaded 37/37 layers to GPU

确认真的在 GPU 上

三项检查,任何一项都够:ollama ps 显示 100% GPU;llama.cpp 的启动日志显示所有层都已卸载;模型加载期间 nvidia-smi 显示显存被占用。在 Windows 上要留意“能跑但很慢”的情况:NVIDIA 控制面板的系统内存回退默认开启,显存不够时会溢出到系统内存而不是报错,于是装不下的模型变成了慢得出奇的模型。调试显存占用时,把 CUDA 系统内存回退策略设为不回退。

bash
nvidia-smi --query-gpu=name,memory.used,memory.total --format=csv

# measure speed on your own card:
./build/bin/llama-bench -m ./models/Qwen3-8B-Q4_K_M.gguf -ngl 99   # pp512 / tg128

出问题时

12GB 显卡上的大多数问题出在上下文,而不是模型。

text
Out of memory after a while, not at load
  → the KV cache grows with the conversation; lower -c / num_ctx

Loads, but generates at a few tok/s
  → layers on the CPU: check ollama ps / the load_tensors line
  → Windows: System Memory Fallback is hiding an out-of-memory

14B fits at 4K, fails at 16K
  → expected (see the table); drop to 8K, or use a 12B model

A 20B MoE model "almost" fits
  → keep some experts on the CPU (--n-cpu-moe), see the GPT-OSS guide

常见问题

12GB 显卡能跑 14B 模型吗?

可以,用 Q4_K_M 并保持较短的上下文。本站估算 Qwen3 14B 在 Q4_K_M、4K 上下文下约 10.0 GB,宽裕;8K 下约 10.7 GB,偏紧;16K 就装不下了。如果在 12GB 显卡上需要长上下文,Gemma 3 12B 是在 32K 下仍然宽裕的较大模型,因为它大部分层使用滑动窗口。

跑本地大模型,RTX 3060 12G 还是 RTX 4060 Ti 16G?

16GB 的卡能装下更多:本索引 89 个模型中,它能在 4K 下宽裕装下 55 个,任何 12GB 卡是 48 个;它还能在长上下文下装下 12GB 卡装不下的 14B 模型。速度上 3060 并不落后 —— 它 360 GB/s 的显存带宽高于 4060 Ti 的 288 GB/s,而模型装下之后,限制生成速度的正是带宽。如果你想跑的模型 12GB 已经装得下,多出的 4GB 并不带来什么。

12GB 显卡能跑 GPT-OSS 20B 吗?

无法完整放在显卡上:本站估算 GPT-OSS 20B 在原生 MXFP4 下、4K 上下文约 12.8 GB,略超上限。由于它是混合专家模型,用 llama.cpp 的 --n-cpu-moe 选项把部分专家留在系统内存里也能跑得不错 —— 具体设置见 GPT-OSS 指南。

这篇指南用到了什么

接下来

看看 🟢 RTX 3060 12G 还能跑哪些模型反向查询 —— 12GB、8192 上下文,按质量排序

本文涉及的模型

它真的跑起来了吗?

复制命令并不等于它能用,所以站内只在这里问一次。除了你的这个回答之外,不收集任何东西。

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。