8GB 显存

Radeon RX 9060 XT 8G 能跑哪些大模型?

在 8GB、4K 上下文下,索引中 87 个模型有 36 个可从容运行,各自取仍留有余量的最高质量档位。

Radeon RX 9060 XT 8G 的简短答案

8 GB,320 GB/s GDDR6。索引中 87 个模型里有 36 个能在 4K 上下文下从容运行,43 个至少能加载。

能装下的最大模型
Stable LM 2 12B Chat — AWQ INT4 下约 7.0 GB —— 4K 时仅剩 1.0 GB,上下文再拉长就要动用这点余量。
留有余量的选择
Qwen3 4B Instruct — Q6_K 下约 4.0 GB —— 占用不到显存的 60%,留下 4.0 GB 给长上下文或第二个进程。
速度上限
Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 320 GB/s 给出的硬上限约为 69 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
你会先撞到的墙
瓶颈是后端支持,不是容量。在 320 GB/s 下,显存子系统与同容量的 NVIDIA 卡相当;真正的变量是你的运行时是否有适配你内核与显卡的可用 ROCm 构建。llama.cpp 与 vLLM 都提供官方 ROCm 支持 —— 这是配置问题,不是硬件天花板。
8GB 能跑的最好的本地大模型

14B · 4

Radeon RX 9060 XT 8G 能跑哪些大模型? — 14B
模型量化档位预估显存余量RTX 4090 上的 tok/s
Stable LM 2 12B Chat12BAWQ INT47.01 GB+1 GB142估算
Solar 10.7B Instruct11BAWQ INT46.42 GB+1.6 GB168估算
Falcon 3 10B Instruct10BGPTQ INT46.12 GB+1.9 GB155估算
Gemma 2 9B Instruct9BAWQ INT46.27 GB+1.7 GB188估算

7B · 22

Radeon RX 9060 XT 8G 能跑哪些大模型? — 7B
模型量化档位预估显存余量RTX 4090 上的 tok/s
GLM-4-9B-Chat9BQ4_K_M5.87 GB+2.1 GB135估算
Qwen3-VL 8B Instruct8BQ4_K_M6.19 GB+1.8 GB140社区
Ministral 3 8B Instruct8BQ5_K_M6.92 GB+1.1 GB—
Qwen2-VL 7B Instruct7BQ4_K_M5.49 GB+2.5 GB72估算
Granite 3.1 8B Instruct8BQ4_K_M5.88 GB+2.1 GB142估算
Qwen3 8B Instruct8BQ4_K_M5.81 GB+2.2 GB142
Llama 3.1 8B Instruct8BQ4_K_M5.64 GB+2.4 GB148
Nous Hermes 3 Llama 3.1 8B8BQ4_K_M5.64 GB+2.4 GB148估算
Aya 23 8B8BQ4_K_M5.64 GB+2.4 GB145估算
OpenChat 3.6 8B8BQ4_K_M5.64 GB+2.4 GB146估算
DeepSeek-R1-Distill-Llama-8B8BQ5_K_M6.51 GB+1.5 GB128估算
InternLM2 7B Chat7BQ4_K_M5.45 GB+2.6 GB148估算
Qwen2.5 7B Instruct7BQ6_K6.77 GB+1.2 GB132
Qwen2.5-Coder 7B Instruct7BQ4_K_M5.07 GB+2.9 GB158估算
DeepSeek-R1-Distill-Qwen-7B7BQ4_K_M5.07 GB+2.9 GB152估算
Gemma 4 E4B ITE4BQ4_K_M4.88 GB+3.1 GB—
OLMo 2 7B Instruct7BQ4_K_M6.82 GB+1.2 GB150估算
WizardLM-2 7B7BQ4_K_M5.14 GB+2.9 GB152估算
Mistral 7B Instruct v0.37BQ6_K6.75 GB+1.3 GB135估算
Zephyr 7B Beta7BQ6_K6.75 GB+1.3 GB132估算
Gemma 4 E2B ITE2BQ8_05.2 GB+2.8 GB—
Gemma 3 4B IT4BQ8_05.05 GB+3 GB145估算

≤3B · 10

Radeon RX 9060 XT 8G 能跑哪些大模型? — ≤3B
模型量化档位预估显存余量RTX 4090 上的 tok/s
Qwen3 4B Instruct4BQ6_K4.05 GB+4 GB145
Phi-4 Mini Instruct3.8BQ8_04.81 GB+3.2 GB262估算
Phi-3.5 Mini Instruct3.8BQ8_05.89 GB+2.1 GB255估算
Llama 3.2 3B Instruct3BQ8_04.05 GB+4 GB285估算
Qwen2.5 3B Instruct3BQ8_03.59 GB+4.4 GB290估算
Gemma 2 2B Instruct2BQ8_03.34 GB+4.7 GB320估算
Qwen3 1.7B Instruct1.7BQ8_02.39 GB+5.6 GB240估算
Qwen2.5 1.5B Instruct1.5BQ8_01.83 GB+6.2 GB410估算
Llama 3.2 1B Instruct1BQ8_01.51 GB+6.5 GB450估算
Qwen2.5 0.5B Instruct0.5BQ8_00.6 GB+7.4 GB540估算

这个列表是怎么算出来的

每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。

另有 7 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。

在这张卡上的实测数据

本索引中没有在 Radeon RX 9060 XT 8G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。 上面表格里的速度一列是 RTX 4090 上的数字,仅作参考,不是这张卡的速度。

再往上一档

Radeon RX 7700 XT(12GB)比这张卡多装下 11 个索引内的模型。 Radeon RX 7700 XT →

常见问题

Radeon RX 9060 XT 8G 上最适合本地运行的大模型是哪个?

日常使用推荐 Qwen3 4B Instruct(Q6_K)—— 在 4K 上下文下约占这张卡 8 GB 中的 4.0 GB,还剩 4.0 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 Stable LM 2 12B Chat(AWQ INT4,约 7.0 GB,余量 1.0 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。

Radeon RX 9060 XT 8G 能跑 Mistral Nemo 12B Instruct 吗?

勉强。它在本索引中最小的构建 AWQ INT4 约需 7.1 GB,而这张卡可用约 8.0 GB —— 在没有其他程序占用时能加载,但没有任何余量留给更长的上下文。上面的清单里没有它,因为那份清单要求模型占用不超过可用显存的 88%。

Radeon RX 9060 XT 8G 跑 8B 模型的 Q4 量化大概有多少 tok/s?

本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 320 GB/s —— 上限约 69 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。

本地跑大模型,Radeon RX 9060 XT 8G 还是 RTX 3070 Ti?

两张卡装得下的模型相同:8 GB 与 8 GB 在 4K 下分别可从容运行 87 个中的 36 个与 36 个。差别在吞吐 —— 320 GB/s 对 608 GB/s,读取权重的速度相差 1.9 倍,而 token 生成正是受此限制。两张卡都装得下的模型,RTX 3070 Ti 生成更快。

在 8GB、4K 上下文下,索引中 87 个模型有 36 个可从容运行,各自取仍留有余量的最高质量档位。

本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-02 RSS → /zh/feed.xml