24GB 显存

Tesla P40 24G 能跑哪些大模型?

在 24GB、4K 上下文下,索引中 81 个模型有 65 个可从容运行,各自取仍留有余量的最高质量档位。

Tesla P40 24G 的简短答案

24 GB,346 GB/s GDDR5。索引中 81 个模型里有 65 个能在 4K 上下文下从容运行,66 个至少能加载。

能装下的最大模型
Seed-OSS 36B InstructAWQ INT4 下约 19.9 GB —— 4K 时仅剩 4.1 GB,上下文再拉长就要动用这点余量。
留有余量的选择
GPT-OSS 20BMXFP4 下约 11.8 GB —— 占用不到显存的 60%,留下 12.2 GB 给长上下文或第二个进程。
速度上限
Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 346 GB/s 给出的硬上限约为 75 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
你会先撞到的墙
瓶颈是带宽,不是容量。本页的模型都装得下,但在 346 GB/s 下,每生成一个 token 这张卡都要把整套权重读一遍 —— 同样是 24 GB 的 RTX 4090 带宽为 1,008 GB/s,搬运这些字节要快 2.9 倍。同一量化档位在这张卡上生成速度会成比例地更慢。
24GB 能跑的最好的本地大模型

32B · 18

Tesla P40 24G 能跑哪些大模型?32B
模型量化档位预估显存余量tok/s
Seed-OSS 36B Instruct36BAWQ INT419.91 GB+4.1 GB55
Command R 35B35BGPTQ INT418.97 GB+5 GB55
Yi 1.5 34B Chat34BAWQ INT419 GB+5 GB52
Qwen3 32B Instruct32BAWQ INT418.22 GB+5.8 GB55
Qwen2.5 32B Instruct32BEXL2 3.5bpw15.96 GB+8 GB68
Qwen2.5-Coder 32B Instruct32BAWQ INT418.08 GB+5.9 GB52
DeepSeek-R1-Distill-Qwen-32B32BEXL2 3.5bpw15.96 GB+8 GB65
Qwen3 30B-A3B Instruct30B-A3BQ4_K_M19.73 GB+4.3 GB95
Qwen3-Coder 30B-A3B Instruct30B-A3BQ4_K_M19.73 GB+4.3 GB92
Qwen3-VL 30B-A3B Instruct30B-A3BQ4_K_M19.73 GB+4.3 GB95
Qwen3.8 27B27BQ4_K_M17.47 GB+6.5 GB
Gemma 3 27B IT27BQ4_K_M19.49 GB+4.5 GB48
Gemma 2 27B Instruct27BQ4_K_M18.81 GB+5.2 GB48
Mistral Small 24B Instruct24BEXL2 4.65bpw15.26 GB+8.7 GB88
Devstral Small 1.1 24B24BQ6_K20.91 GB+3.1 GB48
Magistral Small 1.2 24B24BQ6_K20.91 GB+3.1 GB47
Codestral 22B22BQ4_K_M15.03 GB+9 GB58
GPT-OSS 20B21B MoEMXFP411.81 GB+12.2 GB195

14B · 17

Tesla P40 24G 能跑哪些大模型?14B
模型量化档位预估显存余量tok/s
InternLM2 20B Chat20BQ5_K_M15.59 GB+8.4 GB68
DeepSeek-Coder-V2-Lite Instruct16BQ8_018.36 GB+5.6 GB118
DeepSeek-V2-Lite Chat16BQ4_K_M10.87 GB+13.1 GB142
StarCoder2 15B15BQ4_K_M10.19 GB+13.8 GB92
Qwen3 14B Instruct14BQ5_K_M11.65 GB+12.4 GB78
Qwen2.5 14B Instruct14BQ5_K_M11.73 GB+12.3 GB86
DeepSeek-R1-Distill-Qwen-14B14BEXL2 4.65bpw9.75 GB+14.3 GB128
Phi-4 14B14BQ5_K_M11.77 GB+12.2 GB78
Phi-3 Medium 14B Instruct14BQ6_K12.86 GB+11.1 GB88
Mistral Nemo 12B Instruct12BQ6_K11.14 GB+12.9 GB95
Gemma 3 12B IT12BQ5_K_M10.6 GB+13.4 GB92
Stable LM 2 12B Chat12BQ4_K_M8.35 GB+15.7 GB108
Jamba 1.5 Mini12BQ4_K_M8.15 GB+15.9 GB95
Llama 3.2 11B Vision Instruct11BQ8_012.9 GB+11.1 GB72
Solar 10.7B Instruct11BQ4_K_M7.6 GB+16.4 GB125
Falcon 3 10B Instruct10BQ4_K_M7.28 GB+16.7 GB118
Gemma 2 9B Instruct9BQ8_011.7 GB+12.3 GB108

7B · 20

Tesla P40 24G 能跑哪些大模型?7B
模型量化档位预估显存余量tok/s
GLM-4-9B-Chat9BQ8_010.16 GB+13.8 GB105
Qwen3-VL 8B Instruct8BQ8_010.39 GB+13.6 GB108
Ministral 3 8B Instruct8BQ8_010.02 GB+14 GB
Qwen2-VL 7B Instruct7BQ4_K_M5.49 GB+18.5 GB72
Granite 3.1 8B Instruct8BQ4_K_M5.88 GB+18.1 GB142
Qwen3 8B Instruct8BQ6_K7.64 GB+16.4 GB122
Llama 3.1 8B Instruct8BQ8_09.47 GB+14.5 GB118
Nous Hermes 3 Llama 3.1 8B8BEXL2 4.65bpw5.43 GB+18.6 GB232
Aya 23 8B8BQ4_K_M5.64 GB+18.4 GB145
OpenChat 3.6 8B8BEXL2 4.65bpw5.43 GB+18.6 GB228
DeepSeek-R1-Distill-Llama-8B8BQ5_K_M6.51 GB+17.5 GB128
InternLM2 7B Chat7BQ4_K_M5.45 GB+18.6 GB148
Qwen2.5 7B Instruct7BQ6_K6.77 GB+17.2 GB132
Qwen2.5-Coder 7B Instruct7BEXL2 4.65bpw4.87 GB+19.1 GB248
WizardLM-2 7B7BQ4_K_M5.07 GB+18.9 GB152
DeepSeek-R1-Distill-Qwen-7B7BEXL2 4.65bpw4.87 GB+19.1 GB210
OLMo 2 7B Instruct7BQ8_010.3 GB+13.7 GB125
Mistral 7B Instruct v0.37BQ6_K6.75 GB+17.3 GB135
Zephyr 7B Beta7BQ6_K6.75 GB+17.3 GB132
Gemma 3 4B IT4BQ8_05.36 GB+18.6 GB145

≤3B · 10

Tesla P40 24G 能跑哪些大模型?≤3B
模型量化档位预估显存余量tok/s
Qwen3 4B Instruct4BQ6_K4.05 GB+20 GB145
Phi-4 Mini Instruct3.8BQ8_04.68 GB+19.3 GB262
Phi-3.5 Mini Instruct3.8BQ8_05.89 GB+18.1 GB255
Llama 3.2 3B Instruct3BQ8_04.05 GB+20 GB285
Qwen2.5 3B Instruct3BQ8_03.67 GB+20.3 GB290
Gemma 2 2B Instruct2BQ8_03.34 GB+20.7 GB320
Qwen3 1.7B Instruct1.7BQ8_02.39 GB+21.6 GB240
Qwen2.5 1.5B Instruct1.5BQ8_01.83 GB+22.2 GB410
Llama 3.2 1B Instruct1BQ8_01.51 GB+22.5 GB450
Qwen2.5 0.5B Instruct0.5BQ8_00.6 GB+23.4 GB540

这个列表是怎么算出来的

每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。

另有 1 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。

在这张卡上的实测数据

本索引中没有在 Tesla P40 24G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。

再往上一档

A100 40G(40GB)比这张卡多装下 3 个索引内的模型。 A100 40G

常见问题

Tesla P40 24G 上最适合本地运行的大模型是哪个?

日常使用推荐 GPT-OSS 20B(MXFP4)—— 在 4K 上下文下约占这张卡 24 GB 中的 11.8 GB,还剩 12.2 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 Seed-OSS 36B Instruct(AWQ INT4,约 19.9 GB,余量 4.1 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。

Tesla P40 24G 能跑 Mixtral 8x7B Instruct 吗?

勉强。它在本索引中最小的构建 AWQ INT4 约需 24.9 GB,而显存为 24 GB —— 在显卡完全空闲时能加载,但没有任何余量留给更长的上下文。上面的清单里没有它,因为那份清单要求模型占用不超过显存的 88%。

Tesla P40 24G 跑 8B 模型的 Q4 量化大概有多少 tok/s?

本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 346 GB/s —— 上限约 75 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。

本地跑大模型,Tesla P40 24G 还是 RTX 4090?

两张卡装得下的模型相同:24 GB 与 24 GB 在 4K 下分别可从容运行 81 个中的 65 个与 65 个。差别在吞吐 —— 346 GB/s 对 1,008 GB/s,读取权重的速度相差 2.9 倍,而 token 生成正是受此限制。两张卡都装得下的模型,RTX 4090 生成更快。

在 24GB、4K 上下文下,索引中 81 个模型有 65 个可从容运行,各自取仍留有余量的最高质量档位。

本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-09-14 RSS → /zh/feed.xml