适用于哪些显卡
本索引里有七张 12GB 的 NVIDIA 卡:RTX 3060 12G、RTX 4070、4070 Super、4070 Ti、RTX 5070,以及 RTX 3080 12G 和 3080 Ti。它们能装下的模型完全一样 —— 决定能否装下的只有容量 —— 但跑起来速度不同,因为生成 token 的速度受显存带宽限制,而带宽从 3060 的 360 GB/s 到 3080 的 912 GB/s 不等。12GB 的 Radeon 或 Arc B580 能装下的模型清单也相同,它们的运行时请看 AMD 和 Intel Arc 指南。
Card Bandwidth ceiling for Qwen3 8B Q4_K_M
RTX 3060 12G 360 GB/s 76 tok/s
RTX 4070 / Super / Ti 504 GB/s 107 tok/s
RTX 5070 672 GB/s 142 tok/s
RTX 3080 12G / Ti 912 GB/s 193 tok/s
Ceilings = bandwidth ÷ weight file size. Not measured here; real speed is lower.能装下什么,以及 14B 从哪里开始装不下
本索引 89 个模型中,有 48 个能在 4K 上下文下宽裕地装进 12GB 显卡,能加载的共 50 个。7B–12B 是宽裕区间,其余取决于上下文长度。Gemma 3 12B 在 Q4_K_M、32K 上下文下约 10.4 GB,仍然宽裕,因为它大部分层只用很短的滑动窗口。Mistral Nemo 12B 在 Q4_K_M、32K 上下文下约 13.2 GB,装不下。14B 是边界:Qwen3 14B 在 Q4_K_M、4K 上下文下约 10.0 GB,宽裕;但在 8K 上下文下约 10.7 GB —— 占显卡 89%,超过了本站的宽裕线 —— 到 16K 就装不下了。
GGUF Q4_K_M 8K 16K 32K
Llama 3.1 8B 6.2 GB 7.3 GB 9.5 GB
Qwen3 8B 6.4 GB 7.7 GB 10.1 GB
Gemma 3 12B 8.8 GB 9.3 GB 10.4 GB
Mistral Nemo 12B 9.1 GB 10.5 GB 13.2 GB ✗
Qwen3 14B 10.7 GB ~ 12.1 GB ✗ 14.9 GB ✗
Phi-4 14B 11.0 GB ~ 12.8 GB ✗ (16K max)
~ = tight (88–105% of the card) ✗ = does not fit用 Ollama 运行
Windows 或 Linux 上最短的路是 Ollama。直接从 Hugging Face 的 GGUF 仓库拉取可以固定具体的量化档位,这一点在这里很关键:12B 模型用 Q4_K_M 还是 Q8_0,就是装得下和装不下的区别。Ollama 有自己的默认上下文长度;需要更长时在会话里调大,调之前先对照上面的表。
ollama run hf.co/Qwen/Qwen3-8B-GGUF:Q4_K_M
# inside the session, for a longer context:
/set parameter num_ctx 16384
ollama ps # PROCESSOR should read 100% GPU或者用 llama.cpp 运行
用 llama.cpp 时,传 -ngl all 和明确的 -c。新版本会自动按显卡容量调整,并保留约 1 GiB 空闲,所以接近上限的模型会悄悄把部分层留在 CPU 上;明确要求全部层上 GPU,能让装不下的模型直接报错,而不是慢吞吞地跑。除非你确实要对局域网提供服务,否则绑定 127.0.0.1。
pip install -U huggingface_hub
hf download Qwen/Qwen3-8B-GGUF --include "Qwen3-8B-Q4_K_M.gguf" --local-dir ./models
./build/bin/llama-server -m ./models/Qwen3-8B-Q4_K_M.gguf \
-ngl all -c 16384 --host 127.0.0.1 --port 8080
# startup log: load_tensors: offloaded 37/37 layers to GPU确认真的在 GPU 上
三项检查,任何一项都够:ollama ps 显示 100% GPU;llama.cpp 的启动日志显示所有层都已卸载;模型加载期间 nvidia-smi 显示显存被占用。在 Windows 上要留意“能跑但很慢”的情况:NVIDIA 控制面板的系统内存回退默认开启,显存不够时会溢出到系统内存而不是报错,于是装不下的模型变成了慢得出奇的模型。调试显存占用时,把 CUDA 系统内存回退策略设为不回退。
nvidia-smi --query-gpu=name,memory.used,memory.total --format=csv
# measure speed on your own card:
./build/bin/llama-bench -m ./models/Qwen3-8B-Q4_K_M.gguf -ngl 99 # pp512 / tg128出问题时
12GB 显卡上的大多数问题出在上下文,而不是模型。
Out of memory after a while, not at load
→ the KV cache grows with the conversation; lower -c / num_ctx
Loads, but generates at a few tok/s
→ layers on the CPU: check ollama ps / the load_tensors line
→ Windows: System Memory Fallback is hiding an out-of-memory
14B fits at 4K, fails at 16K
→ expected (see the table); drop to 8K, or use a 12B model
A 20B MoE model "almost" fits
→ keep some experts on the CPU (--n-cpu-moe), see the GPT-OSS guide常见问题
12GB 显卡能跑 14B 模型吗?
可以,用 Q4_K_M 并保持较短的上下文。本站估算 Qwen3 14B 在 Q4_K_M、4K 上下文下约 10.0 GB,宽裕;8K 下约 10.7 GB,偏紧;16K 就装不下了。如果在 12GB 显卡上需要长上下文,Gemma 3 12B 是在 32K 下仍然宽裕的较大模型,因为它大部分层使用滑动窗口。
跑本地大模型,RTX 3060 12G 还是 RTX 4060 Ti 16G?
16GB 的卡能装下更多:本索引 89 个模型中,它能在 4K 下宽裕装下 55 个,任何 12GB 卡是 48 个;它还能在长上下文下装下 12GB 卡装不下的 14B 模型。速度上 3060 并不落后 —— 它 360 GB/s 的显存带宽高于 4060 Ti 的 288 GB/s,而模型装下之后,限制生成速度的正是带宽。如果你想跑的模型 12GB 已经装得下,多出的 4GB 并不带来什么。
12GB 显卡能跑 GPT-OSS 20B 吗?
无法完整放在显卡上:本站估算 GPT-OSS 20B 在原生 MXFP4 下、4K 上下文约 12.8 GB,略超上限。由于它是混合专家模型,用 llama.cpp 的 --n-cpu-moe 选项把部分专家留在系统内存里也能跑得不错 —— 具体设置见 GPT-OSS 指南。
这篇指南用到了什么
- 对应推荐
- 12GB 能跑的最好的本地大模型
接下来
看看 🟢 RTX 3060 12G 还能跑哪些模型反向查询 —— 12GB、8192 上下文,按质量排序本文涉及的模型
它真的跑起来了吗?
复制命令并不等于它能用,所以站内只在这里问一次。除了你的这个回答之外,不收集任何东西。
相关指南
8GB 显卡入门指南:3060 / 4060 / 3070
最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
Intel Arc 显卡:llama.cpp(SYCL)或 Ollama(Vulkan)
在 Arc B580、B570、A770、A750 上跑 GGUF —— SYCL 编译、Ollama 路线、如何确认真的在用 GPU,以及 8–16 GB 能装下什么。