简短的回答
两款 DGX Spark 用的是同一颗 GB10 芯片、同样 273 GB/s 的内存;对本地模型而言,唯一要紧的差别是容量。NVIDIA 公布 64GB 版售价 4,999 美元,2026 年 10 月 23 日起通过宏碁、华硕、戴尔、技嘉、惠普和微星发售。在 4K 上下文下,本索引 90 个模型中有 82 个能宽裕装进 64GB 版,128GB 版是 84 个——32GB 的 RTX 5090 是 74 个。两款 Spark 的差距不大,但恰好落在人们买 Spark 的理由上:100B 级的混合专家(MoE)模型。
64GB 版装不下 GPT-OSS 120B
GPT-OSS 120B 在 MXFP4、8K 上下文下约 66.5 GB——比整台机器的内存还多,而 CPU 和 DGX OS 也住在同一块内存里。换 Q4_K_M 转换版也救不回来:GPT-OSS 120B 在 Q4_K_M、8K 上下文下约 62.9 GB,占这块内存的 98%,操作系统就没有空间了。在 128GB 版上,原生版本只占约一半内存。GLM-4.5-Air 和 Llama 4 Scout 在 Q4_K_M 下也是同样的情况;在 64GB 上它们需要用 Q3_K_M。注意本站把超出这块内存的模型一律判为装不下:独立显卡的小幅超出可以溢出到系统内存,但 Spark 除了这块内存之外没有别的系统内存。
GGUF 8K 32K 128K 64GB 128GB
GPT-OSS 20B MXFP4 12.9 GB 13.5 GB 16.0 GB ok ok
Llama 3.3 70B Q4_K_M 47.5 GB 55.7 GB 88.7 GB ok* ok
GLM-4.5-Air Q3_K_M 55.2 GB 59.9 GB 78.9 GB ok† ok
GLM-4.5-Air Q4_K_M 68.7 GB 73.5 GB 92.5 GB ✗ ok
Llama 4 Scout Q4_K_M 70.7 GB 72.0 GB 77.0 GB ✗ ok
GPT-OSS 120B Q4_K_M 62.9 GB 63.8 GB 67.5 GB ✗ ok
GPT-OSS 120B MXFP4 66.5 GB 67.5 GB 71.2 GB ✗ ok
Qwen3 235B-A22B Q3_K_M 120.4 GB 125.3 GB — ✗ ✗
ok = within 88% of the pool * up to the 32K column † 8K column only
✗ = over 88%; past 100% it cannot load at all64GB 适合跑什么
64GB 版是跑 70B 稠密模型的机器。Llama 3.3 70B 在 Q4_K_M、32K 上下文下约 55.7 GB,在宽裕线以内,而任何单张消费级显卡都装不下它。GPT-OSS 20B 在 MXFP4、128K 上下文下约 16.0 GB,能跑满整个上下文窗口,大部分内存还空着。GLM-4.5-Air 在 Q3_K_M、8K 上下文下约 55.2 GB,是这里最大的 MoE 选项,只是量化档位比内存充裕时会选的低。如果打算跑 GPT-OSS 120B、Q4_K_M 的 GLM-4.5-Air,或者 70B 的长上下文,就买 128GB 版。
速度:两款的上限都是 273 GB/s
生成每个 token 都要把激活的权重读一遍,所以带宽除以读取的字节数就是硬上限。稠密模型要读整个文件:Llama 3.3 70B(Q4_K_M)在任一款 Spark 上的上限约 7 tok/s。这正是这台机器的取舍——对于它能装下的模型,RTX 5090 的 1,792 GB/s 约快 6.6 倍。混合专家模型只读取激活的专家,所以 GPT-OSS 和 GLM-4.5-Air 才是这台机器的天然搭档。本站没有 Spark 的实测记录,不公布它的 tok/s 数字;请用 llama-bench 自己测。
配置:Ollama 或 llama.cpp
Spark 是 Arm 架构(arm64)机器,装的任何软件都必须有 arm64 版本。Ollama 的 GPU 文档把 GB10(DGX Spark)列为计算能力 12.1,标准的 Linux 安装脚本支持 arm64。llama.cpp 要以 GGML_CUDA=ON 编译:它的 CMake 只有在 CUDA 工具包为 12.9 或更新时才加入 GB10 的原生架构。预编译的 :server-cuda13 容器镜像提供 arm64 版本;较旧的 :server-cuda 镜像基于 CUDA 12.8,不含 GB10 的原生内核。除非确实要对局域网提供服务,否则把服务绑定到 127.0.0.1。
# Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama run gpt-oss:20b # 64GB and 128GB
ollama run gpt-oss:120b # 128GB only
# llama.cpp, built on the Spark itself
nvcc --version # 12.9 or newer for GB10 native kernels
git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j
./build/bin/llama-server -hf ggml-org/gpt-oss-120b-GGUF --jinja \
-ngl all -c 16384 --host 127.0.0.1 --port 8080 # 128GB model确认它真的跑在 GPU 上
统一内存让常用的检查方法变了样。nvidia-smi 会列出进程,但在这颗集成 GPU 上不报告显存占用数字,所以它没法告诉你模型装不装得下。用 Ollama 时,ollama ps 的 PROCESSOR 列会显示分配情况——要看到 100% GPU。用 llama.cpp 时,启动日志应显示所有层都已卸载。独立显卡上的一个习惯在这里不适用:--n-cpu-moe 把专家留在系统内存里以节省显存,但在 Spark 上那是同一块内存,什么也省不下,只会拖慢生成。
ollama ps
NAME SIZE PROCESSOR CONTEXT
gpt-oss:20b ... 100% GPU ...
llama.cpp log:
load_tensors: offloaded 37/37 layers to GPU
Fails to load on 64GB with a 100B-class model
→ expected; see the table above (use Q3_K_M, or the 128GB model)
"no kernel image is available"
→ llama.cpp built against CUDA older than 12.9; rebuild, or use :server-cuda13常见问题
64GB 版 DGX Spark 能跑 GPT-OSS 120B 吗?
不能。本站估算 GPT-OSS 120B 在 MXFP4、8K 上下文下约 66.5 GB,比整台机器的 64 GB 还多;Q4_K_M 转换版约 62.9 GB,仍然没给共用同一块内存的 DGX OS 留下运行空间。GPT-OSS 20B 可以轻松装下,128GB 版跑 120B 也还剩约一半内存。
DGX Spark 买 64GB 还是 128GB?
按你想跑的最大模型来决定。在 4K 上下文下,64GB 版能宽裕装下本索引 90 个模型中的 82 个,128GB 版是 84 个;两者芯片相同、带宽同为 273 GB/s,所以谁也不比谁快。只有 128GB 版装得下的,是 4-bit 的 100B 级混合专家模型——GPT-OSS 120B,以及 Q4_K_M 的 GLM-4.5-Air 和 Llama 4 Scout——再加上 70B 的长上下文。
跑本地大模型,DGX Spark 比 RTX 5090 快吗?
在两者都装得下的模型上不快。token 生成受内存带宽限制,5090 是 1,792 GB/s,Spark 是 273 GB/s,相差约 6.6 倍。Spark 的优势在容量:70B 稠密模型和 100B 级混合专家模型,任何 32GB 显卡都完全装不下。
这篇指南用到了什么
接下来
看看 🟩 DGX Spark 64G 还能跑哪些模型反向查询 —— 64GB、8192 上下文,按质量排序本文涉及的模型
它真的跑起来了吗?
复制命令并不等于它能用,所以站内只在这里问一次。除了你的这个回答之外,不收集任何东西。
相关指南
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
Intel Arc 显卡:llama.cpp(SYCL)或 Ollama(Vulkan)
在 Arc B580、B570、A770、A750 上跑 GGUF —— SYCL 编译、Ollama 路线、如何确认真的在用 GPU,以及 8–16 GB 能装下什么。
RTX 5090:32GB 显存在本地大模型上到底多出什么
RTX 5090 能装下而 24GB 卡装不下的是什么:模型数量没多几个,但上下文长得多、速度上限更高。数字来自计算器,附 Blackwell 的配置要点。