64GB 显存

DGX Spark 64G 能跑哪些大模型?

在 64GB、4K 上下文下,索引中 90 个模型有 82 个可从容运行,各自取仍留有余量的最高质量档位。

DGX Spark 64G 的简短答案

64 GB,273 GB/s Unified LPDDR5X(带宽与 128 GB 版相同,均为 273 GB/s。GB10 的 CPU、GPU 和 DGX OS 本身共用这一块内存。NVIDIA 没有公布 GPU 可用的固定比例,所以本站按整块内存判定能否装下——超出它的模型一律装不下,因为没有另外的系统内存可以溢出。)。索引中 90 个模型里有 82 个能在 4K 上下文下从容运行,83 个至少能加载。

能装下的最大模型
Llama 4 Scout 17B (16E) — Q3_K_M 下约 55.9 GB —— 4K 时仅剩 8.1 GB,上下文再拉长就要动用这点余量。
留有余量的选择
Jamba 1.5 Mini — Q4_K_M 下约 33.0 GB —— 占用不到显存的 60%,留下 31.0 GB 给长上下文或第二个进程。
速度上限
Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 273 GB/s 给出的硬上限约为 59 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
你会先撞到的墙
瓶颈是带宽,以及只有一块内存。64 GB 能装下任何单张消费级显卡都装不下的模型,但其中每一个字节——CPU、GPU 和 DGX OS 都一样——都来自同一组 273 GB/s的 LPDDR5X,只有独显旗舰的几分之一。它后面没有可以溢出的系统内存,所以本站把超过这块内存的模型一律判为装不下。本页最大的稠密模型 Llama 3.2 90B Vision Instruct(Q3_K_M)在它上面的上限约为 7 tok/s;混合专家(MoE)模型每个 token 只读取激活的专家,实际速度远快于它的总参数量所暗示的。

70B+ · 8

DGX Spark 64G 能跑哪些大模型? — 70B+
模型量化档位预估显存余量RTX 4090 上的 tok/s
Llama 4 Scout 17B (16E)109B MoEQ3_K_M55.92 GB+8.1 GB—
GLM-4.5-Air106B MoEQ3_K_M54.37 GB+9.6 GB—
Llama 3.2 90B Vision Instruct90BQ3_K_M46.16 GB+17.8 GB—
Qwen2.5 72B Instruct72BQ5_K_M55.31 GB+8.7 GB—
Llama 3.1 70B Instruct70BQ5_K_M53.75 GB+10.3 GB—
Llama 3.3 70B Instruct70BQ5_K_M53.75 GB+10.3 GB—
DeepSeek-R1-Distill-Llama-70B70BQ4_K_M46.1 GB+17.9 GB—
Jamba 1.5 Mini52B-A12BQ4_K_M33.01 GB+31 GB—

32B · 24

DGX Spark 64G 能跑哪些大模型? — 32B
模型量化档位预估显存余量RTX 4090 上的 tok/s
Kimi Linear 48B-A3B Instruct48B-A3BQ8_053.33 GB+10.7 GB—
Mixtral 8x7B Instruct47B MoEQ4_K_M30.13 GB+33.9 GB—
Seed-OSS 36B Instruct36BQ5_K_M27.81 GB+36.2 GB—
Command R 35B35BQ4_K_M22.86 GB+41.1 GB42估算
Yi 1.5 34B Chat34BQ4_K_M22.82 GB+41.2 GB40估算
Qwen3 32B Instruct32BQ4_K_M21.85 GB+42.2 GB42
Qwen2.5 32B Instruct32BQ4_K_M21.69 GB+42.3 GB44
Qwen2.5-Coder 32B Instruct32BQ4_K_M21.69 GB+42.3 GB44估算
DeepSeek-R1-Distill-Qwen-32B32BQ4_K_M21.69 GB+42.3 GB42估算
Gemma 4 31B IT31BQ8_035.72 GB+28.3 GB—
Qwen3 30B-A3B Instruct30B-A3BQ5_K_M23.04 GB+41 GB82
Qwen3-Coder 30B-A3B Instruct30B-A3BQ5_K_M23.04 GB+41 GB80
Qwen3-VL 30B-A3B Instruct30B-A3BQ8_034.28 GB+29.7 GB—
GLM-4.7-Flash30B-A3BQ8_033.47 GB+30.5 GB—
Qwen3.8 27B27BQ4_K_M17.47 GB+46.5 GB—
Gemma 3 27B IT27BQ4_K_M18.37 GB+45.6 GB48社区
Gemma 2 27B Instruct27BQ5_K_M21.76 GB+42.2 GB42估算
Gemma 4 26B-A4B IT26B-A4BQ8_028.42 GB+35.6 GB—
Mistral Small 24B Instruct24BEXL2 4.65bpw15.26 GB+48.7 GB—
Devstral Small 1.1 24B24BQ6_K20.91 GB+43.1 GB48估算
Magistral Small 1.2 24B24BQ6_K20.91 GB+43.1 GB47估算
Codestral 22B22BQ4_K_M15.03 GB+49 GB58估算
ERNIE 4.5 21B-A3B21B-A3BQ8_024.44 GB+39.6 GB—
GPT-OSS 20B21B MoEMXFP412.76 GB+51.2 GB195社区

14B · 16

DGX Spark 64G 能跑哪些大模型? — 14B
模型量化档位预估显存余量RTX 4090 上的 tok/s
InternLM2 20B Chat20BQ5_K_M15.59 GB+48.4 GB68估算
DeepSeek-Coder-V2-Lite Instruct16B-A2.4BQ8_017.56 GB+46.4 GB118估算
DeepSeek-V2-Lite Chat16B-A2.4BQ4_K_M10.08 GB+53.9 GB142估算
StarCoder2 15B15BQ4_K_M10.19 GB+53.8 GB92估算
Qwen3 14B Instruct14BQ5_K_M11.65 GB+52.4 GB78
Qwen2.5 14B Instruct14BQ5_K_M11.73 GB+52.3 GB86估算
DeepSeek-R1-Distill-Qwen-14B14BEXL2 4.65bpw9.75 GB+54.3 GB128
Phi-4 14B14BQ5_K_M11.77 GB+52.2 GB78估算
Phi-3 Medium 14B Instruct14BQ6_K12.86 GB+51.1 GB88估算
Mistral Nemo 12B Instruct12BQ6_K11.14 GB+52.9 GB95估算
Gemma 3 12B IT12BQ5_K_M9.84 GB+54.2 GB92估算
Stable LM 2 12B Chat12BQ4_K_M8.35 GB+55.7 GB108估算
Llama 3.2 11B Vision Instruct11BQ8_012.9 GB+51.1 GB72估算
Solar 10.7B Instruct11BQ4_K_M7.6 GB+56.4 GB125估算
Falcon 3 10B Instruct10BQ4_K_M7.28 GB+56.7 GB118估算
Gemma 2 9B Instruct9BQ8_011.7 GB+52.3 GB108估算

7B · 23

DGX Spark 64G 能跑哪些大模型? — 7B
模型量化档位预估显存余量RTX 4090 上的 tok/s
GLM-4-9B-Chat9BQ8_010.16 GB+53.8 GB105估算
Qwen3-VL 8B Instruct8BQ8_010.39 GB+53.6 GB108估算
Ministral 3 8B Instruct8BQ8_010.02 GB+54 GB—
Qwen2-VL 7B Instruct7BQ4_K_M5.49 GB+58.5 GB72估算
Granite 3.1 8B Instruct8BQ4_K_M5.88 GB+58.1 GB142估算
Qwen3 8B Instruct8BQ6_K7.64 GB+56.4 GB122
Llama 3.1 8B Instruct8BQ8_09.47 GB+54.5 GB118
Nous Hermes 3 Llama 3.1 8B8BEXL2 4.65bpw5.43 GB+58.6 GB232估算
Aya 23 8B8BQ4_K_M5.64 GB+58.4 GB145估算
OpenChat 3.6 8B8BEXL2 4.65bpw5.43 GB+58.6 GB228估算
DeepSeek-R1-Distill-Llama-8B8BQ5_K_M6.51 GB+57.5 GB128估算
InternLM2 7B Chat7BQ4_K_M5.45 GB+58.6 GB148估算
Qwen2.5 7B Instruct7BQ6_K6.77 GB+57.2 GB132
Qwen2.5-Coder 7B Instruct7BEXL2 4.65bpw4.87 GB+59.1 GB248估算
DeepSeek-R1-Distill-Qwen-7B7BEXL2 4.65bpw4.87 GB+59.1 GB210估算
Gemma 4 E4B ITE4BQ8_08.46 GB+55.5 GB—
OLMo 2 7B Instruct7BQ8_010.3 GB+53.7 GB125估算
OLMo 3 7B Instruct7BQ8_010.3 GB+53.7 GB—
WizardLM-2 7B7BQ4_K_M5.14 GB+58.9 GB152估算
Mistral 7B Instruct v0.37BQ6_K6.75 GB+57.3 GB135估算
Zephyr 7B Beta7BQ6_K6.75 GB+57.3 GB132估算
Gemma 4 E2B ITE2BQ8_05.2 GB+58.8 GB—
Gemma 3 4B IT4BQ8_05.05 GB+59 GB145估算

≤3B · 11

DGX Spark 64G 能跑哪些大模型? — ≤3B
模型量化档位预估显存余量RTX 4090 上的 tok/s
Qwen3 4B Instruct4BQ6_K4.05 GB+60 GB145
Phi-4 Mini Instruct3.8BQ8_04.81 GB+59.2 GB262估算
Phi-3.5 Mini Instruct3.8BQ8_05.89 GB+58.1 GB255估算
Llama 3.2 3B Instruct3BQ8_04.05 GB+60 GB285估算
Qwen2.5 3B Instruct3BQ8_03.59 GB+60.4 GB290估算
SmolLM3 3B3BQ8_03.73 GB+60.3 GB—
Gemma 2 2B Instruct2BQ8_03.34 GB+60.7 GB320估算
Qwen3 1.7B Instruct1.7BQ8_02.39 GB+61.6 GB240估算
Qwen2.5 1.5B Instruct1.5BQ8_01.83 GB+62.2 GB410估算
Llama 3.2 1B Instruct1BQ8_01.51 GB+62.5 GB450估算
Qwen2.5 0.5B Instruct0.5BQ8_00.6 GB+63.4 GB540估算

这个列表是怎么算出来的

每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。

另有 1 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。

在这张卡上的实测数据

本索引中没有在 DGX Spark 64G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。 上面表格里的速度一列是 RTX 4090 上的数字,仅作参考,不是这张卡的速度。

显存预算相同的显卡

同样是 64GB,但放在系统内存里是另一台机器 —— 本页所有模型都「装得下」,速度却由内存通道决定,而不是显卡总线: 64 GB RAM (CPU)

    这张卡的部署指南

    针对 DGX Spark 64G 的运行时或显存容量编写的分步指南,包括具体命令,以及确认模型确实跑在这张卡上的检查方法。

    再往上一档

    DGX Spark 128G(128GB)比这张卡多装下 2 个索引内的模型。 DGX Spark 128G →

    常见问题

    DGX Spark 64G 上最适合本地运行的大模型是哪个?

    日常使用推荐 Jamba 1.5 Mini(Q4_K_M)—— 在 4K 上下文下约占这张卡 64 GB 中的 33.0 GB,还剩 31.0 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 Llama 4 Scout 17B (16E)(Q3_K_M,约 55.9 GB,余量 8.1 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。

    DGX Spark 64G 能跑 GPT-OSS 120B 吗?

    不可靠。它在本索引中最小的构建 Q4_K_M 约需 62.7 GB,占这台机器 64 GB 的 98%,而 DGX OS 本身也跑在同一块内存里,能不能加载取决于系统自己占了多少,更长的上下文则完全没有余量。官方原生的 MXFP4 版本约 66.4 GB,比整块内存还大。这台机器能从容运行的最大模型是 Llama 4 Scout 17B (16E)。

    DGX Spark 64G 跑 8B 模型的 Q4 量化大概有多少 tok/s?

    本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 273 GB/s —— 上限约 59 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。

    本地跑大模型,DGX Spark 64G 还是 Mac M1 Max 64G?

    两者装得下的模型并不相同:4K 下 DGX Spark 64G 可从容运行 90 个中的 82 个,Mac M1 Max 64G 为 76 个——macOS 会从 Mac M1 Max 64G 的统一内存里留出一部分不给 GPU,可用约 48 GB。另一个差别在吞吐 —— 273 GB/s 对 400 GB/s,读取权重的速度相差 1.5 倍,而 token 生成正是受此限制。两张卡都装得下的模型,Mac M1 Max 64G 生成更快。

    在 64GB、4K 上下文下,索引中 90 个模型有 82 个可从容运行,各自取仍留有余量的最高质量档位。

    本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-05 RSS → /zh/feed.xml