8GB 能跑的最好的本地大模型

结论: 通用场景选 Stable LM 2 12B Chat(AWQ INT4)—— 8GB 中占 7.0 GB,剩 1.0 GB。另外:Falcon 3 10B Instruct (写代码), Qwen3-VL 8B Instruct (图像)。

这里的「最好」指的是:在留有余量的前提下,本类别中能装进这张卡的最大模型,并取仍装得下的最高质量档位。本索引衡量的是显存占用与已公开的困惑度,不是任务质量 —— 它无法告诉你哪个模型答得更好,也不会假装可以。

推荐

用途模型量化档位预估显存余量损失理由
通用Stable LM 2 12B Chat12BAWQ INT47.0 GB1.0 GB4.5%这个显存预算下能装进的最大模型(不分类别)。在 AWQ INT4 下相对 FP16 损失 4.5% 困惑度。仅限 4K 上下文 —— 更长的窗口装不下。
写代码Falcon 3 10B Instruct10BGPTQ INT46.1 GB1.9 GB4.8%本类别中仍留有余量的最大模型。在 GPTQ INT4 下相对 FP16 损失 4.8% 困惑度。仅限 4K 上下文 —— 更长的窗口装不下。
图像Qwen3-VL 8B Instruct8BQ4_K_M6.2 GB1.8 GB3.0%本类别中仍留有余量的最大模型。在 Q4_K_M 下相对 FP16 损失 3.0% 困惑度。仅限 4K 上下文 —— 更长的窗口装不下。

按 4K 上下文加 10% 激活缓冲估算;索引中 81 个模型有 35 个能从容装进这个预算。「损失」是量化发布者公布的相对 FP16 困惑度,没有公布的显示为短横线。

适用于这些显卡

能不能装下完全由容量决定,所以这里每张卡返回的清单都一样。不同的是读取权重的速度 —— 每张卡自己的页面标注了带宽以及它意味着什么。

装不下的是什么

最接近的是 Phi-3 Medium 14B Instruct。它在本索引中最小的构建 AWQ INT4 约需 8.2 GB —— 比 8GB 超出 0.2 GB,而且这还没算 4K 以外的上下文。卸载到系统内存确实能加载,但速度将由内存决定 —— 那是另一台机器,不是换个更小的量化档位。

上下文拉长之后

在 4K 上下文下有 35 个模型能从容装下,16K 时是 24 个,32K 时是 16 个。权重没变 —— 涨的是 KV 缓存。

按你的实际上下文长度计算

常见问题

2026 年 8 GB显存最适合跑哪个本地大模型?

通用场景选 Stable LM 2 12B Chat(AWQ INT4)—— 8 GB 中占 7.0 GB,剩 1.0 GB。要写代码就选 Falcon 3 10B Instruct,要处理图像就选 Qwen3-VL 8B Instruct。这里的「最好」指的是本类别中能留有余量装进这张卡的最大模型 —— 本索引衡量的是显存与已公开的困惑度,不是任务质量,因此无法就「答得好不好」给模型排名。

8 GB 能装下多少个模型?

本索引 81 个模型中有 35 个能在 4K 上下文下从容装下 —— 「从容」指估算占用不超过显存的 88%,给显示输出和运行时留出余量。到 16K 时降到 24 个,32K 时是 16 个:变化的是 KV 缓存,不是权重。

8 GB 跑不了什么?

最接近的是 Phi-3 Medium 14B Instruct:它在本站最小的构建 AWQ INT4 约需 8.2 GB —— 超出 0.2 GB,而且这还没算 4K 以外的上下文。把一部分权重卸载到系统内存确实能加载,但速度将由内存决定而不是由你的显卡决定;那是另一台机器,不是换个更小的量化档位。

所有 8 GB 的卡跑的模型都一样吗?

装得下的模型是一样的 —— 能不能装下完全由容量决定,所以这一档的 6 张卡返回的是同一份清单。不同的是读取权重的速度:每生成一个 token 都要把整套权重读一遍,所以显存带宽决定了上限,而显存相同的两张卡在这一项上可以相差 2.5 倍以上。每张卡自己的页面都标注了带宽及其含义。