32GB 显存

Radeon AI PRO R9700 32G 能跑哪些大模型?

在 32GB、4K 上下文下,索引中 90 个模型有 74 个可从容运行,各自取仍留有余量的最高质量档位。

Radeon AI PRO R9700 32G 的简短答案

32 GB,640 GB/s GDDR6。索引中 90 个模型里有 74 个能在 4K 上下文下从容运行,75 个至少能加载。

能装下的最大模型
Jamba 1.5 Mini — AWQ INT4 下约 27.2 GB —— 4K 时仅剩 4.8 GB,上下文再拉长就要动用这点余量。
留有余量的选择
GLM-4.7-Flash — Q4_K_M 下约 19.2 GB —— 占用不到显存的 60%,留下 12.8 GB 给长上下文或第二个进程。
速度上限
Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 640 GB/s 给出的硬上限约为 139 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
你会先撞到的墙
瓶颈是后端支持,不是容量。在 640 GB/s 下,显存子系统与同容量的 NVIDIA 卡相当;真正的变量是你的运行时是否有适配你内核与显卡的可用 ROCm 构建。llama.cpp 与 vLLM 都提供官方 ROCm 支持 —— 这是配置问题,不是硬件天花板。
32GB 能跑的最好的本地大模型

70B+ · 1

Radeon AI PRO R9700 32G 能跑哪些大模型? — 70B+
模型量化档位预估显存余量RTX 4090 上的 tok/s
Jamba 1.5 Mini52B-A12BAWQ INT427.24 GB+4.8 GB—

32B · 23

Radeon AI PRO R9700 32G 能跑哪些大模型? — 32B
模型量化档位预估显存余量RTX 4090 上的 tok/s
Mixtral 8x7B Instruct47B MoEAWQ INT424.95 GB+7.1 GB—
Seed-OSS 36B Instruct36BQ5_K_M27.81 GB+4.2 GB—
Command R 35B35BQ4_K_M22.86 GB+9.1 GB42估算
Yi 1.5 34B Chat34BQ4_K_M22.82 GB+9.2 GB40估算
Qwen3 32B Instruct32BQ4_K_M21.85 GB+10.1 GB42
Qwen2.5 32B Instruct32BQ4_K_M21.69 GB+10.3 GB44
Qwen2.5-Coder 32B Instruct32BQ4_K_M21.69 GB+10.3 GB44估算
DeepSeek-R1-Distill-Qwen-32B32BQ4_K_M21.69 GB+10.3 GB42估算
Gemma 4 31B IT31BQ4_K_M21.08 GB+10.9 GB—
Qwen3 30B-A3B Instruct30B-A3BQ5_K_M23.04 GB+9 GB82
Qwen3-Coder 30B-A3B Instruct30B-A3BQ5_K_M23.04 GB+9 GB80
Qwen3-VL 30B-A3B Instruct30B-A3BQ4_K_M19.73 GB+12.3 GB95社区
GLM-4.7-Flash30B-A3BQ4_K_M19.19 GB+12.8 GB—
Qwen3.8 27B27BQ4_K_M17.47 GB+14.5 GB—
Gemma 3 27B IT27BQ4_K_M18.37 GB+13.6 GB48社区
Gemma 2 27B Instruct27BQ5_K_M21.76 GB+10.2 GB42估算
Gemma 4 26B-A4B IT26B-A4BQ4_K_M16.39 GB+15.6 GB—
Mistral Small 24B Instruct24BQ4_K_M15.89 GB+16.1 GB62估算
Devstral Small 1.1 24B24BQ6_K20.91 GB+11.1 GB48估算
Magistral Small 1.2 24B24BQ6_K20.91 GB+11.1 GB47估算
Codestral 22B22BQ4_K_M15.03 GB+17 GB58估算
ERNIE 4.5 21B-A3B21B-A3BQ8_024.44 GB+7.6 GB—
GPT-OSS 20B21B MoEMXFP412.76 GB+19.2 GB195社区

14B · 16

Radeon AI PRO R9700 32G 能跑哪些大模型? — 14B
模型量化档位预估显存余量RTX 4090 上的 tok/s
InternLM2 20B Chat20BQ5_K_M15.59 GB+16.4 GB68估算
DeepSeek-Coder-V2-Lite Instruct16B-A2.4BQ8_017.56 GB+14.4 GB118估算
DeepSeek-V2-Lite Chat16B-A2.4BQ4_K_M10.08 GB+21.9 GB142估算
StarCoder2 15B15BQ4_K_M10.19 GB+21.8 GB92估算
Qwen3 14B Instruct14BQ5_K_M11.65 GB+20.4 GB78
Qwen2.5 14B Instruct14BQ5_K_M11.73 GB+20.3 GB86估算
DeepSeek-R1-Distill-Qwen-14B14BQ4_K_M10.14 GB+21.9 GB95
Phi-4 14B14BQ5_K_M11.77 GB+20.2 GB78估算
Phi-3 Medium 14B Instruct14BQ6_K12.86 GB+19.1 GB88估算
Mistral Nemo 12B Instruct12BQ6_K11.14 GB+20.9 GB95估算
Gemma 3 12B IT12BQ5_K_M9.84 GB+22.2 GB92估算
Stable LM 2 12B Chat12BQ4_K_M8.35 GB+23.7 GB108估算
Llama 3.2 11B Vision Instruct11BQ8_012.9 GB+19.1 GB72估算
Solar 10.7B Instruct11BQ4_K_M7.6 GB+24.4 GB125估算
Falcon 3 10B Instruct10BQ4_K_M7.28 GB+24.7 GB118估算
Gemma 2 9B Instruct9BQ8_011.7 GB+20.3 GB108估算

7B · 23

Radeon AI PRO R9700 32G 能跑哪些大模型? — 7B
模型量化档位预估显存余量RTX 4090 上的 tok/s
GLM-4-9B-Chat9BQ8_010.16 GB+21.8 GB105估算
Qwen3-VL 8B Instruct8BQ8_010.39 GB+21.6 GB108估算
Ministral 3 8B Instruct8BQ8_010.02 GB+22 GB—
Qwen2-VL 7B Instruct7BQ4_K_M5.49 GB+26.5 GB72估算
Granite 3.1 8B Instruct8BQ4_K_M5.88 GB+26.1 GB142估算
Qwen3 8B Instruct8BQ6_K7.64 GB+24.4 GB122
Llama 3.1 8B Instruct8BQ8_09.47 GB+22.5 GB118
Nous Hermes 3 Llama 3.1 8B8BQ4_K_M5.64 GB+26.4 GB148估算
Aya 23 8B8BQ4_K_M5.64 GB+26.4 GB145估算
OpenChat 3.6 8B8BQ4_K_M5.64 GB+26.4 GB146估算
DeepSeek-R1-Distill-Llama-8B8BQ5_K_M6.51 GB+25.5 GB128估算
InternLM2 7B Chat7BQ4_K_M5.45 GB+26.6 GB148估算
Qwen2.5 7B Instruct7BQ6_K6.77 GB+25.2 GB132
Qwen2.5-Coder 7B Instruct7BQ4_K_M5.07 GB+26.9 GB158估算
DeepSeek-R1-Distill-Qwen-7B7BQ4_K_M5.07 GB+26.9 GB152估算
Gemma 4 E4B ITE4BQ8_08.46 GB+23.5 GB—
OLMo 2 7B Instruct7BQ8_010.3 GB+21.7 GB125估算
OLMo 3 7B Instruct7BQ8_010.3 GB+21.7 GB—
WizardLM-2 7B7BQ4_K_M5.14 GB+26.9 GB152估算
Mistral 7B Instruct v0.37BQ6_K6.75 GB+25.3 GB135估算
Zephyr 7B Beta7BQ6_K6.75 GB+25.3 GB132估算
Gemma 4 E2B ITE2BQ8_05.2 GB+26.8 GB—
Gemma 3 4B IT4BQ8_05.05 GB+27 GB145估算

≤3B · 11

Radeon AI PRO R9700 32G 能跑哪些大模型? — ≤3B
模型量化档位预估显存余量RTX 4090 上的 tok/s
Qwen3 4B Instruct4BQ6_K4.05 GB+28 GB145
Phi-4 Mini Instruct3.8BQ8_04.81 GB+27.2 GB262估算
Phi-3.5 Mini Instruct3.8BQ8_05.89 GB+26.1 GB255估算
Llama 3.2 3B Instruct3BQ8_04.05 GB+28 GB285估算
Qwen2.5 3B Instruct3BQ8_03.59 GB+28.4 GB290估算
SmolLM3 3B3BQ8_03.73 GB+28.3 GB—
Gemma 2 2B Instruct2BQ8_03.34 GB+28.7 GB320估算
Qwen3 1.7B Instruct1.7BQ8_02.39 GB+29.6 GB240估算
Qwen2.5 1.5B Instruct1.5BQ8_01.83 GB+30.2 GB410估算
Llama 3.2 1B Instruct1BQ8_01.51 GB+30.5 GB450估算
Qwen2.5 0.5B Instruct0.5BQ8_00.6 GB+31.4 GB540估算

这个列表是怎么算出来的

每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。

另有 1 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。

在这张卡上的实测数据

本索引中没有在 Radeon AI PRO R9700 32G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。 上面表格里的速度一列是 RTX 4090 上的数字,仅作参考,不是这张卡的速度。

显存预算相同的显卡

能装下什么由显存决定,所以同类型的每张 32GB 显卡返回的列表都一样。这几个页面给出的不是不同答案 —— 它们的差别在吞吐,而本索引并未逐卡实测吞吐。

同样是 32GB,但放在系统内存里是另一台机器 —— 本页所有模型都「装得下」,速度却由内存通道决定,而不是显卡总线: 32 GB RAM (CPU)

这张卡的部署指南

针对 Radeon AI PRO R9700 32G 的运行时或显存容量编写的分步指南,包括具体命令,以及确认模型确实跑在这张卡上的检查方法。

再往上一档

Radeon PRO W7900 48G(48GB)比这张卡多装下 6 个索引内的模型。 Radeon PRO W7900 48G →

常见问题

Radeon AI PRO R9700 32G 上最适合本地运行的大模型是哪个?

日常使用推荐 GLM-4.7-Flash(Q4_K_M)—— 在 4K 上下文下约占这张卡 32 GB 中的 19.2 GB,还剩 12.8 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 Jamba 1.5 Mini(AWQ INT4,约 27.2 GB,余量 4.8 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。

Radeon AI PRO R9700 32G 能跑 Llama 3.1 70B Instruct 吗?

不能。它在本索引中最小的构建 AWQ INT4 约需 38.3 GB,而这张卡可用约 32.0 GB —— 在 4K 之外的上下文还没算上之前就已经差了 6.3 GB。这张卡能从容运行的最大模型是 Jamba 1.5 Mini。

Radeon AI PRO R9700 32G 跑 8B 模型的 Q4 量化大概有多少 tok/s?

本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 640 GB/s —— 上限约 139 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。

本地跑大模型,Radeon AI PRO R9700 32G 还是 RTX 5090?

两张卡装得下的模型相同:32 GB 与 32 GB 在 4K 下分别可从容运行 90 个中的 74 个与 74 个。差别在吞吐 —— 640 GB/s 对 1,792 GB/s,读取权重的速度相差 2.8 倍,而 token 生成正是受此限制。两张卡都装得下的模型,RTX 5090 生成更快。

在 32GB、4K 上下文下,索引中 90 个模型有 74 个可从容运行,各自取仍留有余量的最高质量档位。

本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-08 RSS → /zh/feed.xml