DGX Spark 128G 能跑哪些大模型?
在 128GB、4K 上下文下,索引中 90 个模型有 84 个可从容运行,各自取仍留有余量的最高质量档位。
DGX Spark 128G 的简短答案
128 GB,273 GB/s Unified LPDDR5X(GB10 的 CPU、GPU 和 DGX OS 本身共用这一块内存。NVIDIA 没有公布 GPU 可用的固定比例,所以本站按整块内存判定能否装下——超出它的模型一律装不下,因为没有另外的系统内存可以溢出。)。索引中 90 个模型里有 84 个能在 4K 上下文下从容运行,85 个至少能加载。
- 能装下的最大模型
- DBRX Instruct — Q4_K_M 下约 84.3 GB —— 4K 时仅剩 43.7 GB,上下文再拉长就要动用这点余量。
- 留有余量的选择
- GPT-OSS 120B — MXFP4 下约 66.4 GB —— 占用不到显存的 60%,留下 61.6 GB 给长上下文或第二个进程。
- 速度上限
- Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 273 GB/s 给出的硬上限约为 59 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
- 你会先撞到的墙
- 瓶颈是带宽,以及只有一块内存。128 GB 能装下任何单张消费级显卡都装不下的模型,但其中每一个字节——CPU、GPU 和 DGX OS 都一样——都来自同一组 273 GB/s的 LPDDR5X,只有独显旗舰的几分之一。它后面没有可以溢出的系统内存,所以本站把超过这块内存的模型一律判为装不下。本页最大的稠密模型 Llama 3.2 90B Vision Instruct(Q4_K_M)在它上面的上限约为 5 tok/s;混合专家(MoE)模型每个 token 只读取激活的专家,实际速度远快于它的总参数量所暗示的。
70B+ · 10
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| DBRX Instruct132B MoE | Q4_K_M | 84.31 GB | +43.7 GB | — |
| GPT-OSS 120B117B MoE | MXFP4 | 66.4 GB | +61.6 GB | — |
| Llama 4 Scout 17B (16E)109B MoE | Q4_K_M | 69.88 GB | +58.1 GB | — |
| GLM-4.5-Air106B MoE | Q4_K_M | 67.94 GB | +60.1 GB | — |
| Llama 3.2 90B Vision Instruct90B | Q4_K_M | 57.5 GB | +70.5 GB | — |
| Qwen2.5 72B Instruct72B | Q5_K_M | 55.31 GB | +72.7 GB | — |
| Llama 3.1 70B Instruct70B | Q5_K_M | 53.75 GB | +74.3 GB | — |
| Llama 3.3 70B Instruct70B | Q5_K_M | 53.75 GB | +74.3 GB | — |
| DeepSeek-R1-Distill-Llama-70B70B | Q4_K_M | 46.1 GB | +81.9 GB | — |
| Jamba 1.5 Mini52B-A12B | Q4_K_M | 33.01 GB | +95 GB | — |
32B · 24
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Kimi Linear 48B-A3B Instruct48B-A3B | Q8_0 | 53.33 GB | +74.7 GB | — |
| Mixtral 8x7B Instruct47B MoE | Q4_K_M | 30.13 GB | +97.9 GB | — |
| Seed-OSS 36B Instruct36B | Q5_K_M | 27.81 GB | +100.2 GB | — |
| Command R 35B35B | Q4_K_M | 22.86 GB | +105.1 GB | 42估算 |
| Yi 1.5 34B Chat34B | Q4_K_M | 22.82 GB | +105.2 GB | 40估算 |
| Qwen3 32B Instruct32B | Q4_K_M | 21.85 GB | +106.2 GB | 42 |
| Qwen2.5 32B Instruct32B | Q4_K_M | 21.69 GB | +106.3 GB | 44 |
| Qwen2.5-Coder 32B Instruct32B | Q4_K_M | 21.69 GB | +106.3 GB | 44估算 |
| DeepSeek-R1-Distill-Qwen-32B32B | Q4_K_M | 21.69 GB | +106.3 GB | 42估算 |
| Gemma 4 31B IT31B | Q8_0 | 35.72 GB | +92.3 GB | — |
| Qwen3 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +105 GB | 82 |
| Qwen3-Coder 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +105 GB | 80 |
| Qwen3-VL 30B-A3B Instruct30B-A3B | Q8_0 | 34.28 GB | +93.7 GB | — |
| GLM-4.7-Flash30B-A3B | Q8_0 | 33.47 GB | +94.5 GB | — |
| Qwen3.8 27B27B | Q4_K_M | 17.47 GB | +110.5 GB | — |
| Gemma 3 27B IT27B | Q4_K_M | 18.37 GB | +109.6 GB | 48社区 |
| Gemma 2 27B Instruct27B | Q5_K_M | 21.76 GB | +106.2 GB | 42估算 |
| Gemma 4 26B-A4B IT26B-A4B | Q8_0 | 28.42 GB | +99.6 GB | — |
| Mistral Small 24B Instruct24B | EXL2 4.65bpw | 15.26 GB | +112.7 GB | — |
| Devstral Small 1.1 24B24B | Q6_K | 20.91 GB | +107.1 GB | 48估算 |
| Magistral Small 1.2 24B24B | Q6_K | 20.91 GB | +107.1 GB | 47估算 |
| Codestral 22B22B | Q4_K_M | 15.03 GB | +113 GB | 58估算 |
| ERNIE 4.5 21B-A3B21B-A3B | Q8_0 | 24.44 GB | +103.6 GB | — |
| GPT-OSS 20B21B MoE | MXFP4 | 12.76 GB | +115.2 GB | 195社区 |
14B · 16
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| InternLM2 20B Chat20B | Q5_K_M | 15.59 GB | +112.4 GB | 68估算 |
| DeepSeek-Coder-V2-Lite Instruct16B-A2.4B | Q8_0 | 17.56 GB | +110.4 GB | 118估算 |
| DeepSeek-V2-Lite Chat16B-A2.4B | Q4_K_M | 10.08 GB | +117.9 GB | 142估算 |
| StarCoder2 15B15B | Q4_K_M | 10.19 GB | +117.8 GB | 92估算 |
| Qwen3 14B Instruct14B | Q5_K_M | 11.65 GB | +116.4 GB | 78 |
| Qwen2.5 14B Instruct14B | Q5_K_M | 11.73 GB | +116.3 GB | 86估算 |
| DeepSeek-R1-Distill-Qwen-14B14B | EXL2 4.65bpw | 9.75 GB | +118.3 GB | 128 |
| Phi-4 14B14B | Q5_K_M | 11.77 GB | +116.2 GB | 78估算 |
| Phi-3 Medium 14B Instruct14B | Q6_K | 12.86 GB | +115.1 GB | 88估算 |
| Mistral Nemo 12B Instruct12B | Q6_K | 11.14 GB | +116.9 GB | 95估算 |
| Gemma 3 12B IT12B | Q5_K_M | 9.84 GB | +118.2 GB | 92估算 |
| Stable LM 2 12B Chat12B | Q4_K_M | 8.35 GB | +119.7 GB | 108估算 |
| Llama 3.2 11B Vision Instruct11B | Q8_0 | 12.9 GB | +115.1 GB | 72估算 |
| Solar 10.7B Instruct11B | Q4_K_M | 7.6 GB | +120.4 GB | 125估算 |
| Falcon 3 10B Instruct10B | Q4_K_M | 7.28 GB | +120.7 GB | 118估算 |
| Gemma 2 9B Instruct9B | Q8_0 | 11.7 GB | +116.3 GB | 108估算 |
7B · 23
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| GLM-4-9B-Chat9B | Q8_0 | 10.16 GB | +117.8 GB | 105估算 |
| Qwen3-VL 8B Instruct8B | Q8_0 | 10.39 GB | +117.6 GB | 108估算 |
| Ministral 3 8B Instruct8B | Q8_0 | 10.02 GB | +118 GB | — |
| Qwen2-VL 7B Instruct7B | Q4_K_M | 5.49 GB | +122.5 GB | 72估算 |
| Granite 3.1 8B Instruct8B | Q4_K_M | 5.88 GB | +122.1 GB | 142估算 |
| Qwen3 8B Instruct8B | Q6_K | 7.64 GB | +120.4 GB | 122 |
| Llama 3.1 8B Instruct8B | Q8_0 | 9.47 GB | +118.5 GB | 118 |
| Nous Hermes 3 Llama 3.1 8B8B | EXL2 4.65bpw | 5.43 GB | +122.6 GB | 232估算 |
| Aya 23 8B8B | Q4_K_M | 5.64 GB | +122.4 GB | 145估算 |
| OpenChat 3.6 8B8B | EXL2 4.65bpw | 5.43 GB | +122.6 GB | 228估算 |
| DeepSeek-R1-Distill-Llama-8B8B | Q5_K_M | 6.51 GB | +121.5 GB | 128估算 |
| InternLM2 7B Chat7B | Q4_K_M | 5.45 GB | +122.6 GB | 148估算 |
| Qwen2.5 7B Instruct7B | Q6_K | 6.77 GB | +121.2 GB | 132 |
| Qwen2.5-Coder 7B Instruct7B | EXL2 4.65bpw | 4.87 GB | +123.1 GB | 248估算 |
| DeepSeek-R1-Distill-Qwen-7B7B | EXL2 4.65bpw | 4.87 GB | +123.1 GB | 210估算 |
| Gemma 4 E4B ITE4B | Q8_0 | 8.46 GB | +119.5 GB | — |
| OLMo 2 7B Instruct7B | Q8_0 | 10.3 GB | +117.7 GB | 125估算 |
| OLMo 3 7B Instruct7B | Q8_0 | 10.3 GB | +117.7 GB | — |
| WizardLM-2 7B7B | Q4_K_M | 5.14 GB | +122.9 GB | 152估算 |
| Mistral 7B Instruct v0.37B | Q6_K | 6.75 GB | +121.3 GB | 135估算 |
| Zephyr 7B Beta7B | Q6_K | 6.75 GB | +121.3 GB | 132估算 |
| Gemma 4 E2B ITE2B | Q8_0 | 5.2 GB | +122.8 GB | — |
| Gemma 3 4B IT4B | Q8_0 | 5.05 GB | +123 GB | 145估算 |
≤3B · 11
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Qwen3 4B Instruct4B | Q6_K | 4.05 GB | +124 GB | 145 |
| Phi-4 Mini Instruct3.8B | Q8_0 | 4.81 GB | +123.2 GB | 262估算 |
| Phi-3.5 Mini Instruct3.8B | Q8_0 | 5.89 GB | +122.1 GB | 255估算 |
| Llama 3.2 3B Instruct3B | Q8_0 | 4.05 GB | +124 GB | 285估算 |
| Qwen2.5 3B Instruct3B | Q8_0 | 3.59 GB | +124.4 GB | 290估算 |
| SmolLM3 3B3B | Q8_0 | 3.73 GB | +124.3 GB | — |
| Gemma 2 2B Instruct2B | Q8_0 | 3.34 GB | +124.7 GB | 320估算 |
| Qwen3 1.7B Instruct1.7B | Q8_0 | 2.39 GB | +125.6 GB | 240估算 |
| Qwen2.5 1.5B Instruct1.5B | Q8_0 | 1.83 GB | +126.2 GB | 410估算 |
| Llama 3.2 1B Instruct1B | Q8_0 | 1.51 GB | +126.5 GB | 450估算 |
| Qwen2.5 0.5B Instruct0.5B | Q8_0 | 0.6 GB | +127.4 GB | 540估算 |
这个列表是怎么算出来的
每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。
另有 1 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。
在这张卡上的实测数据
本索引中没有在 DGX Spark 128G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。 上面表格里的速度一列是 RTX 4090 上的数字,仅作参考,不是这张卡的速度。
显存预算相同的显卡
同样是 128GB,但放在系统内存里是另一台机器 —— 本页所有模型都「装得下」,速度却由内存通道决定,而不是显卡总线: 128 GB RAM (CPU)
这张卡的部署指南
针对 DGX Spark 128G 的运行时或显存容量编写的分步指南,包括具体命令,以及确认模型确实跑在这张卡上的检查方法。
常见问题
DGX Spark 128G 上最适合本地运行的大模型是哪个?
日常使用推荐 GPT-OSS 120B(MXFP4)—— 在 4K 上下文下约占这张卡 128 GB 中的 66.4 GB,还剩 61.6 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 DBRX Instruct(Q4_K_M,约 84.3 GB,余量 43.7 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。
DGX Spark 128G 能跑 Qwen3 235B-A22B Instruct 吗?
不可靠。它在本索引中最小的构建 Q3_K_M 约需 119.6 GB,占这台机器 128 GB 的 93%,而 DGX OS 本身也跑在同一块内存里,能不能加载取决于系统自己占了多少,更长的上下文则完全没有余量。这台机器能从容运行的最大模型是 DBRX Instruct。
DGX Spark 128G 跑 8B 模型的 Q4 量化大概有多少 tok/s?
本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 273 GB/s —— 上限约 59 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。
本地跑大模型,DGX Spark 128G 还是 Mac M5 Max 128G?
两张卡装得下的模型相同:128 GB 与 128 GB 在 4K 下分别可从容运行 90 个中的 84 个与 84 个。差别在吞吐 —— 273 GB/s 对 614 GB/s,读取权重的速度相差 2.2 倍,而 token 生成正是受此限制。两张卡都装得下的模型,Mac M5 Max 128G 生成更快。
在 128GB、4K 上下文下,索引中 90 个模型有 84 个可从容运行,各自取仍留有余量的最高质量档位。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-05 RSS → /zh/feed.xml