8GB 显存
RTX 3070 能跑哪些大模型?
在 8GB、4K 上下文下,索引中 79 个模型有 34 个可从容运行,各自取仍留有余量的最高质量档位。
14B · 5
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| Stable LM 2 12B Chat12B | AWQ INT4 | 7.01 GB | +1 GB | 142 |
| Jamba 1.5 Mini12B | AWQ INT4 | 6.82 GB | +1.2 GB | 125 |
| Solar 10.7B Instruct11B | AWQ INT4 | 6.42 GB | +1.6 GB | 168 |
| Falcon 3 10B Instruct10B | GPTQ INT4 | 6.12 GB | +1.9 GB | 155 |
| Gemma 2 9B Instruct9B | AWQ INT4 | 6.27 GB | +1.7 GB | 188 |
7B · 19
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| GLM-4-9B-Chat9B | Q4_K_M | 5.87 GB | +2.1 GB | 135 |
| Qwen3-VL 8B Instruct8B | Q4_K_M | 6.19 GB | +1.8 GB | 140 |
| Qwen2-VL 7B Instruct7B | Q4_K_M | 5.49 GB | +2.5 GB | 72 |
| Granite 3.1 8B Instruct8B | Q4_K_M | 5.88 GB | +2.1 GB | 142 |
| Qwen3 8B Instruct8B | EXL2 4.65bpw | 5.59 GB | +2.4 GB | 228 |
| Llama 3.1 8B Instruct8B | EXL2 4.65bpw | 5.43 GB | +2.6 GB | 235 |
| Nous Hermes 3 Llama 3.1 8B8B | EXL2 4.65bpw | 5.43 GB | +2.6 GB | 232 |
| Aya 23 8B8B | Q4_K_M | 5.64 GB | +2.4 GB | 145 |
| OpenChat 3.6 8B8B | EXL2 4.65bpw | 5.43 GB | +2.6 GB | 228 |
| DeepSeek-R1-Distill-Llama-8B8B | Q5_K_M | 6.51 GB | +1.5 GB | 128 |
| InternLM2 7B Chat7B | Q4_K_M | 5.45 GB | +2.6 GB | 148 |
| Qwen2.5 7B Instruct7B | Q6_K | 6.77 GB | +1.2 GB | 132 |
| Qwen2.5-Coder 7B Instruct7B | EXL2 4.65bpw | 4.87 GB | +3.1 GB | 248 |
| WizardLM-2 7B7B | Q4_K_M | 5.07 GB | +2.9 GB | 152 |
| DeepSeek-R1-Distill-Qwen-7B7B | EXL2 4.65bpw | 4.87 GB | +3.1 GB | 210 |
| OLMo 2 7B Instruct7B | Q4_K_M | 6.82 GB | +1.2 GB | 150 |
| Mistral 7B Instruct v0.37B | Q6_K | 6.75 GB | +1.3 GB | 135 |
| Zephyr 7B Beta7B | Q6_K | 6.75 GB | +1.3 GB | 132 |
| Gemma 3 4B IT4B | Q8_0 | 5.36 GB | +2.6 GB | 145 |
≤3B · 10
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| Qwen3 4B Instruct4B | Q6_K | 4.05 GB | +4 GB | 145 |
| Phi-4 Mini Instruct3.8B | Q8_0 | 4.68 GB | +3.3 GB | 262 |
| Phi-3.5 Mini Instruct3.8B | Q8_0 | 5.89 GB | +2.1 GB | 255 |
| Llama 3.2 3B Instruct3B | Q8_0 | 4.05 GB | +4 GB | 285 |
| Qwen2.5 3B Instruct3B | Q8_0 | 3.67 GB | +4.3 GB | 290 |
| Gemma 2 2B Instruct2B | Q8_0 | 3.34 GB | +4.7 GB | 320 |
| Qwen3 1.7B Instruct1.7B | Q8_0 | 2.39 GB | +5.6 GB | 240 |
| Qwen2.5 1.5B Instruct1.5B | Q8_0 | 1.83 GB | +6.2 GB | 410 |
| Llama 3.2 1B Instruct1B | Q8_0 | 1.51 GB | +6.5 GB | 450 |
| Qwen2.5 0.5B Instruct0.5B | Q8_0 | 0.6 GB | +7.4 GB | 540 |
这个列表是怎么算出来的
每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。
再往上一档
RTX 3080 10G(10GB)比这张卡多装下 9 个索引内的模型。 RTX 3080 10G →
在 8GB、4K 上下文下,索引中 79 个模型有 34 个可从容运行,各自取仍留有余量的最高质量档位。