Radeon AI PRO R9700 32G 能跑哪些大模型?
在 32GB、4K 上下文下,索引中 90 个模型有 74 个可从容运行,各自取仍留有余量的最高质量档位。
Radeon AI PRO R9700 32G 的简短答案
32 GB,640 GB/s GDDR6。索引中 90 个模型里有 74 个能在 4K 上下文下从容运行,75 个至少能加载。
- 能装下的最大模型
- Jamba 1.5 Mini — AWQ INT4 下约 27.2 GB —— 4K 时仅剩 4.8 GB,上下文再拉长就要动用这点余量。
- 留有余量的选择
- GLM-4.7-Flash — Q4_K_M 下约 19.2 GB —— 占用不到显存的 60%,留下 12.8 GB 给长上下文或第二个进程。
- 速度上限
- Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 640 GB/s 给出的硬上限约为 139 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
- 你会先撞到的墙
- 瓶颈是后端支持,不是容量。在 640 GB/s 下,显存子系统与同容量的 NVIDIA 卡相当;真正的变量是你的运行时是否有适配你内核与显卡的可用 ROCm 构建。llama.cpp 与 vLLM 都提供官方 ROCm 支持 —— 这是配置问题,不是硬件天花板。
70B+ · 1
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Jamba 1.5 Mini52B-A12B | AWQ INT4 | 27.24 GB | +4.8 GB | — |
32B · 23
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Mixtral 8x7B Instruct47B MoE | AWQ INT4 | 24.95 GB | +7.1 GB | — |
| Seed-OSS 36B Instruct36B | Q5_K_M | 27.81 GB | +4.2 GB | — |
| Command R 35B35B | Q4_K_M | 22.86 GB | +9.1 GB | 42估算 |
| Yi 1.5 34B Chat34B | Q4_K_M | 22.82 GB | +9.2 GB | 40估算 |
| Qwen3 32B Instruct32B | Q4_K_M | 21.85 GB | +10.1 GB | 42 |
| Qwen2.5 32B Instruct32B | Q4_K_M | 21.69 GB | +10.3 GB | 44 |
| Qwen2.5-Coder 32B Instruct32B | Q4_K_M | 21.69 GB | +10.3 GB | 44估算 |
| DeepSeek-R1-Distill-Qwen-32B32B | Q4_K_M | 21.69 GB | +10.3 GB | 42估算 |
| Gemma 4 31B IT31B | Q4_K_M | 21.08 GB | +10.9 GB | — |
| Qwen3 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +9 GB | 82 |
| Qwen3-Coder 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +9 GB | 80 |
| Qwen3-VL 30B-A3B Instruct30B-A3B | Q4_K_M | 19.73 GB | +12.3 GB | 95社区 |
| GLM-4.7-Flash30B-A3B | Q4_K_M | 19.19 GB | +12.8 GB | — |
| Qwen3.8 27B27B | Q4_K_M | 17.47 GB | +14.5 GB | — |
| Gemma 3 27B IT27B | Q4_K_M | 18.37 GB | +13.6 GB | 48社区 |
| Gemma 2 27B Instruct27B | Q5_K_M | 21.76 GB | +10.2 GB | 42估算 |
| Gemma 4 26B-A4B IT26B-A4B | Q4_K_M | 16.39 GB | +15.6 GB | — |
| Mistral Small 24B Instruct24B | Q4_K_M | 15.89 GB | +16.1 GB | 62估算 |
| Devstral Small 1.1 24B24B | Q6_K | 20.91 GB | +11.1 GB | 48估算 |
| Magistral Small 1.2 24B24B | Q6_K | 20.91 GB | +11.1 GB | 47估算 |
| Codestral 22B22B | Q4_K_M | 15.03 GB | +17 GB | 58估算 |
| ERNIE 4.5 21B-A3B21B-A3B | Q8_0 | 24.44 GB | +7.6 GB | — |
| GPT-OSS 20B21B MoE | MXFP4 | 12.76 GB | +19.2 GB | 195社区 |
14B · 16
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| InternLM2 20B Chat20B | Q5_K_M | 15.59 GB | +16.4 GB | 68估算 |
| DeepSeek-Coder-V2-Lite Instruct16B-A2.4B | Q8_0 | 17.56 GB | +14.4 GB | 118估算 |
| DeepSeek-V2-Lite Chat16B-A2.4B | Q4_K_M | 10.08 GB | +21.9 GB | 142估算 |
| StarCoder2 15B15B | Q4_K_M | 10.19 GB | +21.8 GB | 92估算 |
| Qwen3 14B Instruct14B | Q5_K_M | 11.65 GB | +20.4 GB | 78 |
| Qwen2.5 14B Instruct14B | Q5_K_M | 11.73 GB | +20.3 GB | 86估算 |
| DeepSeek-R1-Distill-Qwen-14B14B | Q4_K_M | 10.14 GB | +21.9 GB | 95 |
| Phi-4 14B14B | Q5_K_M | 11.77 GB | +20.2 GB | 78估算 |
| Phi-3 Medium 14B Instruct14B | Q6_K | 12.86 GB | +19.1 GB | 88估算 |
| Mistral Nemo 12B Instruct12B | Q6_K | 11.14 GB | +20.9 GB | 95估算 |
| Gemma 3 12B IT12B | Q5_K_M | 9.84 GB | +22.2 GB | 92估算 |
| Stable LM 2 12B Chat12B | Q4_K_M | 8.35 GB | +23.7 GB | 108估算 |
| Llama 3.2 11B Vision Instruct11B | Q8_0 | 12.9 GB | +19.1 GB | 72估算 |
| Solar 10.7B Instruct11B | Q4_K_M | 7.6 GB | +24.4 GB | 125估算 |
| Falcon 3 10B Instruct10B | Q4_K_M | 7.28 GB | +24.7 GB | 118估算 |
| Gemma 2 9B Instruct9B | Q8_0 | 11.7 GB | +20.3 GB | 108估算 |
7B · 23
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| GLM-4-9B-Chat9B | Q8_0 | 10.16 GB | +21.8 GB | 105估算 |
| Qwen3-VL 8B Instruct8B | Q8_0 | 10.39 GB | +21.6 GB | 108估算 |
| Ministral 3 8B Instruct8B | Q8_0 | 10.02 GB | +22 GB | — |
| Qwen2-VL 7B Instruct7B | Q4_K_M | 5.49 GB | +26.5 GB | 72估算 |
| Granite 3.1 8B Instruct8B | Q4_K_M | 5.88 GB | +26.1 GB | 142估算 |
| Qwen3 8B Instruct8B | Q6_K | 7.64 GB | +24.4 GB | 122 |
| Llama 3.1 8B Instruct8B | Q8_0 | 9.47 GB | +22.5 GB | 118 |
| Nous Hermes 3 Llama 3.1 8B8B | Q4_K_M | 5.64 GB | +26.4 GB | 148估算 |
| Aya 23 8B8B | Q4_K_M | 5.64 GB | +26.4 GB | 145估算 |
| OpenChat 3.6 8B8B | Q4_K_M | 5.64 GB | +26.4 GB | 146估算 |
| DeepSeek-R1-Distill-Llama-8B8B | Q5_K_M | 6.51 GB | +25.5 GB | 128估算 |
| InternLM2 7B Chat7B | Q4_K_M | 5.45 GB | +26.6 GB | 148估算 |
| Qwen2.5 7B Instruct7B | Q6_K | 6.77 GB | +25.2 GB | 132 |
| Qwen2.5-Coder 7B Instruct7B | Q4_K_M | 5.07 GB | +26.9 GB | 158估算 |
| DeepSeek-R1-Distill-Qwen-7B7B | Q4_K_M | 5.07 GB | +26.9 GB | 152估算 |
| Gemma 4 E4B ITE4B | Q8_0 | 8.46 GB | +23.5 GB | — |
| OLMo 2 7B Instruct7B | Q8_0 | 10.3 GB | +21.7 GB | 125估算 |
| OLMo 3 7B Instruct7B | Q8_0 | 10.3 GB | +21.7 GB | — |
| WizardLM-2 7B7B | Q4_K_M | 5.14 GB | +26.9 GB | 152估算 |
| Mistral 7B Instruct v0.37B | Q6_K | 6.75 GB | +25.3 GB | 135估算 |
| Zephyr 7B Beta7B | Q6_K | 6.75 GB | +25.3 GB | 132估算 |
| Gemma 4 E2B ITE2B | Q8_0 | 5.2 GB | +26.8 GB | — |
| Gemma 3 4B IT4B | Q8_0 | 5.05 GB | +27 GB | 145估算 |
≤3B · 11
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Qwen3 4B Instruct4B | Q6_K | 4.05 GB | +28 GB | 145 |
| Phi-4 Mini Instruct3.8B | Q8_0 | 4.81 GB | +27.2 GB | 262估算 |
| Phi-3.5 Mini Instruct3.8B | Q8_0 | 5.89 GB | +26.1 GB | 255估算 |
| Llama 3.2 3B Instruct3B | Q8_0 | 4.05 GB | +28 GB | 285估算 |
| Qwen2.5 3B Instruct3B | Q8_0 | 3.59 GB | +28.4 GB | 290估算 |
| SmolLM3 3B3B | Q8_0 | 3.73 GB | +28.3 GB | — |
| Gemma 2 2B Instruct2B | Q8_0 | 3.34 GB | +28.7 GB | 320估算 |
| Qwen3 1.7B Instruct1.7B | Q8_0 | 2.39 GB | +29.6 GB | 240估算 |
| Qwen2.5 1.5B Instruct1.5B | Q8_0 | 1.83 GB | +30.2 GB | 410估算 |
| Llama 3.2 1B Instruct1B | Q8_0 | 1.51 GB | +30.5 GB | 450估算 |
| Qwen2.5 0.5B Instruct0.5B | Q8_0 | 0.6 GB | +31.4 GB | 540估算 |
这个列表是怎么算出来的
每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。
另有 1 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。
在这张卡上的实测数据
本索引中没有在 Radeon AI PRO R9700 32G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。 上面表格里的速度一列是 RTX 4090 上的数字,仅作参考,不是这张卡的速度。
显存预算相同的显卡
能装下什么由显存决定,所以同类型的每张 32GB 显卡返回的列表都一样。这几个页面给出的不是不同答案 —— 它们的差别在吞吐,而本索引并未逐卡实测吞吐。
同样是 32GB,但放在系统内存里是另一台机器 —— 本页所有模型都「装得下」,速度却由内存通道决定,而不是显卡总线: 32 GB RAM (CPU)
这张卡的部署指南
针对 Radeon AI PRO R9700 32G 的运行时或显存容量编写的分步指南,包括具体命令,以及确认模型确实跑在这张卡上的检查方法。
再往上一档
Radeon PRO W7900 48G(48GB)比这张卡多装下 6 个索引内的模型。 Radeon PRO W7900 48G →
常见问题
Radeon AI PRO R9700 32G 上最适合本地运行的大模型是哪个?
日常使用推荐 GLM-4.7-Flash(Q4_K_M)—— 在 4K 上下文下约占这张卡 32 GB 中的 19.2 GB,还剩 12.8 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 Jamba 1.5 Mini(AWQ INT4,约 27.2 GB,余量 4.8 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。
Radeon AI PRO R9700 32G 能跑 Llama 3.1 70B Instruct 吗?
不能。它在本索引中最小的构建 AWQ INT4 约需 38.3 GB,而这张卡可用约 32.0 GB —— 在 4K 之外的上下文还没算上之前就已经差了 6.3 GB。这张卡能从容运行的最大模型是 Jamba 1.5 Mini。
Radeon AI PRO R9700 32G 跑 8B 模型的 Q4 量化大概有多少 tok/s?
本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 640 GB/s —— 上限约 139 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。
本地跑大模型,Radeon AI PRO R9700 32G 还是 RTX 5090?
两张卡装得下的模型相同:32 GB 与 32 GB 在 4K 下分别可从容运行 90 个中的 74 个与 74 个。差别在吞吐 —— 640 GB/s 对 1,792 GB/s,读取权重的速度相差 2.8 倍,而 token 生成正是受此限制。两张卡都装得下的模型,RTX 5090 生成更快。
在 32GB、4K 上下文下,索引中 90 个模型有 74 个可从容运行,各自取仍留有余量的最高质量档位。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-08 RSS → /zh/feed.xml