20GB 显存

Radeon RX 7900 XT 能跑哪些大模型?

在 20GB、4K 上下文下,索引中 79 个模型有 60 个可从容运行,各自取仍留有余量的最高质量档位。

32B · 14

Radeon RX 7900 XT 能跑哪些大模型?32B
模型量化档位预估显存余量tok/s
Qwen3 32B Instruct32BEXL2 3.5bpw16.08 GB+3.9 GB62
Qwen2.5 32B Instruct32BEXL2 3.5bpw15.96 GB+4 GB68
Qwen2.5-Coder 32B Instruct32BEXL2 3.5bpw15.96 GB+4 GB65
DeepSeek-R1-Distill-Qwen-32B32BEXL2 3.5bpw15.96 GB+4 GB65
Qwen3 30B-A3B Instruct30B-A3BAWQ INT416.35 GB+3.6 GB118
Qwen3-Coder 30B-A3B Instruct30B-A3BAWQ INT416.35 GB+3.6 GB115
Qwen3-VL 30B-A3B Instruct30B-A3BAWQ INT416.35 GB+3.6 GB112
Gemma 3 27B IT27BAWQ INT416.45 GB+3.6 GB62
Gemma 2 27B Instruct27BAWQ INT415.79 GB+4.2 GB58
Mistral Small 24B Instruct24BEXL2 4.65bpw15.26 GB+4.7 GB88
Devstral Small 1.1 24B24BEXL2 4.65bpw15.02 GB+5 GB88
Magistral Small 1.2 24B24BEXL2 4.65bpw15.02 GB+5 GB86
Codestral 22B22BQ4_K_M15.03 GB+5 GB58
GPT-OSS 20B21B MoEMXFP411.81 GB+8.2 GB195

14B · 17

Radeon RX 7900 XT 能跑哪些大模型?14B
模型量化档位预估显存余量tok/s
InternLM2 20B Chat20BQ5_K_M15.59 GB+4.4 GB68
DeepSeek-Coder-V2-Lite Instruct16BQ4_K_M10.87 GB+9.1 GB145
DeepSeek-V2-Lite Chat16BQ4_K_M10.87 GB+9.1 GB142
StarCoder2 15B15BQ4_K_M10.19 GB+9.8 GB92
Qwen3 14B Instruct14BQ5_K_M11.65 GB+8.4 GB78
Qwen2.5 14B Instruct14BQ5_K_M11.73 GB+8.3 GB86
DeepSeek-R1-Distill-Qwen-14B14BEXL2 4.65bpw9.75 GB+10.3 GB128
Phi-4 14B14BQ5_K_M11.77 GB+8.2 GB78
Phi-3 Medium 14B Instruct14BQ6_K12.86 GB+7.1 GB88
Mistral Nemo 12B Instruct12BQ6_K11.14 GB+8.9 GB95
Gemma 3 12B IT12BQ5_K_M10.6 GB+9.4 GB92
Stable LM 2 12B Chat12BQ4_K_M8.35 GB+11.7 GB108
Jamba 1.5 Mini12BQ4_K_M8.15 GB+11.9 GB95
Llama 3.2 11B Vision Instruct11BQ8_012.9 GB+7.1 GB72
Solar 10.7B Instruct11BQ4_K_M7.6 GB+12.4 GB125
Falcon 3 10B Instruct10BQ4_K_M7.28 GB+12.7 GB118
Gemma 2 9B Instruct9BQ8_011.7 GB+8.3 GB108

7B · 19

Radeon RX 7900 XT 能跑哪些大模型?7B
模型量化档位预估显存余量tok/s
GLM-4-9B-Chat9BQ8_010.16 GB+9.8 GB105
Qwen3-VL 8B Instruct8BQ8_010.39 GB+9.6 GB108
Qwen2-VL 7B Instruct7BQ4_K_M5.49 GB+14.5 GB72
Granite 3.1 8B Instruct8BQ4_K_M5.88 GB+14.1 GB142
Qwen3 8B Instruct8BQ6_K7.64 GB+12.4 GB122
Llama 3.1 8B Instruct8BQ8_09.47 GB+10.5 GB118
Nous Hermes 3 Llama 3.1 8B8BEXL2 4.65bpw5.43 GB+14.6 GB232
Aya 23 8B8BQ4_K_M5.64 GB+14.4 GB145
OpenChat 3.6 8B8BEXL2 4.65bpw5.43 GB+14.6 GB228
DeepSeek-R1-Distill-Llama-8B8BQ5_K_M6.51 GB+13.5 GB128
InternLM2 7B Chat7BQ4_K_M5.45 GB+14.6 GB148
Qwen2.5 7B Instruct7BQ6_K6.77 GB+13.2 GB132
Qwen2.5-Coder 7B Instruct7BEXL2 4.65bpw4.87 GB+15.1 GB248
WizardLM-2 7B7BQ4_K_M5.07 GB+14.9 GB152
DeepSeek-R1-Distill-Qwen-7B7BEXL2 4.65bpw4.87 GB+15.1 GB210
OLMo 2 7B Instruct7BQ8_010.3 GB+9.7 GB125
Mistral 7B Instruct v0.37BQ6_K6.75 GB+13.3 GB135
Zephyr 7B Beta7BQ6_K6.75 GB+13.3 GB132
Gemma 3 4B IT4BQ8_05.36 GB+14.6 GB145

≤3B · 10

Radeon RX 7900 XT 能跑哪些大模型?≤3B
模型量化档位预估显存余量tok/s
Qwen3 4B Instruct4BQ6_K4.05 GB+16 GB145
Phi-4 Mini Instruct3.8BQ8_04.68 GB+15.3 GB262
Phi-3.5 Mini Instruct3.8BQ8_05.89 GB+14.1 GB255
Llama 3.2 3B Instruct3BQ8_04.05 GB+16 GB285
Qwen2.5 3B Instruct3BQ8_03.67 GB+16.3 GB290
Gemma 2 2B Instruct2BQ8_03.34 GB+16.7 GB320
Qwen3 1.7B Instruct1.7BQ8_02.39 GB+17.6 GB240
Qwen2.5 1.5B Instruct1.5BQ8_01.83 GB+18.2 GB410
Llama 3.2 1B Instruct1BQ8_01.51 GB+18.5 GB450
Qwen2.5 0.5B Instruct0.5BQ8_00.6 GB+19.4 GB540

这个列表是怎么算出来的

每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。

再往上一档

Radeon RX 7900 XTX(24GB)比这张卡多装下 3 个索引内的模型。 Radeon RX 7900 XTX

在 20GB、4K 上下文下,索引中 79 个模型有 60 个可从容运行,各自取仍留有余量的最高质量档位。