进阶端侧 / 本地 4 分钟阅读发布于

DGX Spark 64GB 与 128GB:各自能跑什么

64GB 和 128GB 两款 DGX Spark 各能装下哪些模型(数字来自计算器):GPT-OSS 120B 需要 128GB 版,70B 稠密模型两款都能装,速度由 273 GB/s 决定。附 Ollama 与 llama.cpp 配置。

面向的技术栈

DGX OS(基于 Ubuntu,arm64)· 新版 Ollama,或基于 CUDA 12.9+、以 GGML_CUDA=ON 编译的 llama.cpp · GGUF

最近一次修改后未重新实机运行 —— 命令请当作起点,而不是已验证的配方。

DGX SparkGB10unified memory64GB128GBGPT-OSSOllamallama.cpp

简短的回答

两款 DGX Spark 用的是同一颗 GB10 芯片、同样 273 GB/s 的内存;对本地模型而言,唯一要紧的差别是容量。NVIDIA 公布 64GB 版售价 4,999 美元,2026 年 10 月 23 日起通过宏碁、华硕、戴尔、技嘉、惠普和微星发售。在 4K 上下文下,本索引 90 个模型中有 82 个能宽裕装进 64GB 版,128GB 版是 84 个——32GB 的 RTX 5090 是 74 个。两款 Spark 的差距不大,但恰好落在人们买 Spark 的理由上:100B 级的混合专家(MoE)模型。

64GB 版装不下 GPT-OSS 120B

GPT-OSS 120B 在 MXFP4、8K 上下文下约 66.5 GB——比整台机器的内存还多,而 CPU 和 DGX OS 也住在同一块内存里。换 Q4_K_M 转换版也救不回来:GPT-OSS 120B 在 Q4_K_M、8K 上下文下约 62.9 GB,占这块内存的 98%,操作系统就没有空间了。在 128GB 版上,原生版本只占约一半内存。GLM-4.5-Air 和 Llama 4 Scout 在 Q4_K_M 下也是同样的情况;在 64GB 上它们需要用 Q3_K_M。注意本站把超出这块内存的模型一律判为装不下:独立显卡的小幅超出可以溢出到系统内存,但 Spark 除了这块内存之外没有别的系统内存。

text
GGUF                         8K        32K       128K     64GB   128GB
GPT-OSS 20B      MXFP4      12.9 GB   13.5 GB   16.0 GB   ok     ok
Llama 3.3 70B    Q4_K_M     47.5 GB   55.7 GB   88.7 GB   ok*    ok
GLM-4.5-Air      Q3_K_M     55.2 GB   59.9 GB   78.9 GB   ok†    ok
GLM-4.5-Air      Q4_K_M     68.7 GB   73.5 GB   92.5 GB   ✗      ok
Llama 4 Scout    Q4_K_M     70.7 GB   72.0 GB   77.0 GB   ✗      ok
GPT-OSS 120B     Q4_K_M     62.9 GB   63.8 GB   67.5 GB   ✗      ok
GPT-OSS 120B     MXFP4      66.5 GB   67.5 GB   71.2 GB   ✗      ok
Qwen3 235B-A22B  Q3_K_M    120.4 GB  125.3 GB     —       ✗      ✗

ok = within 88% of the pool   * up to the 32K column   † 8K column only
✗ = over 88%; past 100% it cannot load at all

64GB 适合跑什么

64GB 版是跑 70B 稠密模型的机器。Llama 3.3 70B 在 Q4_K_M、32K 上下文下约 55.7 GB,在宽裕线以内,而任何单张消费级显卡都装不下它。GPT-OSS 20B 在 MXFP4、128K 上下文下约 16.0 GB,能跑满整个上下文窗口,大部分内存还空着。GLM-4.5-Air 在 Q3_K_M、8K 上下文下约 55.2 GB,是这里最大的 MoE 选项,只是量化档位比内存充裕时会选的低。如果打算跑 GPT-OSS 120B、Q4_K_M 的 GLM-4.5-Air,或者 70B 的长上下文,就买 128GB 版。

速度:两款的上限都是 273 GB/s

生成每个 token 都要把激活的权重读一遍,所以带宽除以读取的字节数就是硬上限。稠密模型要读整个文件:Llama 3.3 70B(Q4_K_M)在任一款 Spark 上的上限约 7 tok/s。这正是这台机器的取舍——对于它能装下的模型,RTX 5090 的 1,792 GB/s 约快 6.6 倍。混合专家模型只读取激活的专家,所以 GPT-OSS 和 GLM-4.5-Air 才是这台机器的天然搭档。本站没有 Spark 的实测记录,不公布它的 tok/s 数字;请用 llama-bench 自己测。

配置:Ollama 或 llama.cpp

Spark 是 Arm 架构(arm64)机器,装的任何软件都必须有 arm64 版本。Ollama 的 GPU 文档把 GB10(DGX Spark)列为计算能力 12.1,标准的 Linux 安装脚本支持 arm64。llama.cpp 要以 GGML_CUDA=ON 编译:它的 CMake 只有在 CUDA 工具包为 12.9 或更新时才加入 GB10 的原生架构。预编译的 :server-cuda13 容器镜像提供 arm64 版本;较旧的 :server-cuda 镜像基于 CUDA 12.8,不含 GB10 的原生内核。除非确实要对局域网提供服务,否则把服务绑定到 127.0.0.1。

bash
# Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama run gpt-oss:20b          # 64GB and 128GB
ollama run gpt-oss:120b         # 128GB only

# llama.cpp, built on the Spark itself
nvcc --version                  # 12.9 or newer for GB10 native kernels
git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j

./build/bin/llama-server -hf ggml-org/gpt-oss-120b-GGUF --jinja \
  -ngl all -c 16384 --host 127.0.0.1 --port 8080   # 128GB model

确认它真的跑在 GPU 上

统一内存让常用的检查方法变了样。nvidia-smi 会列出进程,但在这颗集成 GPU 上不报告显存占用数字,所以它没法告诉你模型装不装得下。用 Ollama 时,ollama ps 的 PROCESSOR 列会显示分配情况——要看到 100% GPU。用 llama.cpp 时,启动日志应显示所有层都已卸载。独立显卡上的一个习惯在这里不适用:--n-cpu-moe 把专家留在系统内存里以节省显存,但在 Spark 上那是同一块内存,什么也省不下,只会拖慢生成。

text
ollama ps
  NAME            SIZE     PROCESSOR    CONTEXT
  gpt-oss:20b     ...      100% GPU     ...

llama.cpp log:
  load_tensors: offloaded 37/37 layers to GPU

Fails to load on 64GB with a 100B-class model
  → expected; see the table above (use Q3_K_M, or the 128GB model)

"no kernel image is available"
  → llama.cpp built against CUDA older than 12.9; rebuild, or use :server-cuda13

常见问题

64GB 版 DGX Spark 能跑 GPT-OSS 120B 吗?

不能。本站估算 GPT-OSS 120B 在 MXFP4、8K 上下文下约 66.5 GB,比整台机器的 64 GB 还多;Q4_K_M 转换版约 62.9 GB,仍然没给共用同一块内存的 DGX OS 留下运行空间。GPT-OSS 20B 可以轻松装下,128GB 版跑 120B 也还剩约一半内存。

DGX Spark 买 64GB 还是 128GB?

按你想跑的最大模型来决定。在 4K 上下文下,64GB 版能宽裕装下本索引 90 个模型中的 82 个,128GB 版是 84 个;两者芯片相同、带宽同为 273 GB/s,所以谁也不比谁快。只有 128GB 版装得下的,是 4-bit 的 100B 级混合专家模型——GPT-OSS 120B,以及 Q4_K_M 的 GLM-4.5-Air 和 Llama 4 Scout——再加上 70B 的长上下文。

跑本地大模型,DGX Spark 比 RTX 5090 快吗?

在两者都装得下的模型上不快。token 生成受内存带宽限制,5090 是 1,792 GB/s,Spark 是 273 GB/s,相差约 6.6 倍。Spark 的优势在容量:70B 稠密模型和 100B 级混合专家模型,任何 32GB 显卡都完全装不下。

这篇指南用到了什么

格式
GGUFAWQ

接下来

看看 🟩 DGX Spark 64G 还能跑哪些模型反向查询 —— 64GB、8192 上下文,按质量排序

本文涉及的模型

它真的跑起来了吗?

复制命令并不等于它能用,所以站内只在这里问一次。除了你的这个回答之外,不收集任何东西。

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。