🧭 格式向导

我该用哪种量化格式?

回答三个问题,根据你的硬件和用途获得数据驱动的推荐。

1.你用什么硬件?

2.你最看重什么?

3.主要用途是什么?

回答问题后点击获取推荐

四种格式,各一段话

GGUF 到处都能跑 —— CPU、NVIDIA、AMD、Intel Arc、苹果芯片 —— 也是唯一支持把模型拆分在显存与内存之间的格式。EXL2 在消费级 NVIDIA 卡上最快,且可以选择小数位的 bpw,但仅支持 CUDA,而且它的运行时 ExLlamaV2 已经归档,没有仍在维护的 API 服务端。AWQ 面向通过 vLLM 的批量服务场景。GPTQ 早于 AWQ,覆盖类似场景,遗留工具链更广。向导只会推荐索引内确实有模型提供的格式。

为什么硬件比偏好更有决定权

大部分打分是在做排除,不是在谈偏好。ExLlamaV2 仅支持 CUDA,所以在 Radeon 上 EXL2 不是"慢一点的选项",而是根本不是选项。AWQ 与 GPTQ 的算子以 CUDA 为先,ROCm 支持不完整且对版本敏感。在苹果芯片上,经 llama.cpp Metal 后端的 GGUF 是唯一完整支持的路径。所以只要选了 AMD 或 Mac,无论你说自己更看重什么,结论都会收敛到 GGUF。

量化档位只属于某一种格式

Q4_K_M 是 GGUF 的档位,4.65bpw 是 EXL2 的档位,INT4 是 AWQ 与 GPTQ 提供的。它们不是同一件事的不同叫法,把两者混在一起的推荐 —— 比如 "EXL2 · Q4_K_M" —— 是在让你去下载一个不存在的东西。这里每一行给出的档位都属于它自己的格式。

常见问题

我有 NVIDIA 卡,是不是该一直用 EXL2?
只有在速度优先、只在本机对话、并且能接受一个已归档的运行时的情况下才是:ExLlamaV2 仍能跑 EXL2,但开发已转到 ExLlamaV3,也已经没有仍在维护的服务端加载 EXL2,所以它无法用来提供 API。GGUF 的工具链广得多,而且在模型无法完全装进显存时是唯一选择;批量吞吐场景下 AWQ + vLLM 更强。向导会按你选择的优先级加权。
bpw 究竟决定了什么?
同时决定体积与质量。位数越少,文件越小、困惑度损失越大,而且关系不是线性的 —— 从 4 bit 降到 3 bit 的质量代价远大于从 8 bit 降到 6 bit。基准页面的困惑度曲线图标出了拐点位置。
我能自己在格式之间转换吗?
正确做法是从原始 FP16 权重重新量化,而不是在量化格式之间互转 —— 从一种有损格式转到另一种会叠加损失。Cookbook 里有一篇自行制作 GGUF 的指南。
为什么没有 HQQ?
格式参考里有它的介绍,但本索引中没有任何模型提供 HQQ 权重。推荐一个背后什么都没有的格式,只会把你带到一个没有结果的页面。