GGUF 详解

GGUF 是什么、哪些运行时能读它、显存开销如何,以及本索引 81 个模型中提供该格式的全部 81 个。

GGUF 是什么

最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。 本索引的 81 个模型中有 81 个提供该格式,共 7 个量化档位 —— Q4_K_M、Q8_0、Q5_K_M、Q3_K_M、Q6_K、Q2_K、MXFP4。

什么运行时能读它

llama.cpp · Ollama。硬件要求:Any — CPU / NVIDIA / AMD / Apple。最擅长的场景:本地 / 端侧部署。强项:兼容任意硬件;CPU+GPU 混合推理;生态最完善;上手极简。短板:慢于 GPU 原生格式;高并发场景非最优。

它要多少显存

Llama 3.1 8B Instruct 在 Q4_K_M 下为每权重 4.85 比特,折合权重 4.6 GB,加上 4K 上下文的 KV 缓存 0.5 GB 与激活缓冲 0.5 GB —— 合计 5.6 GB;本索引中能从容装下它的最小显卡是 RTX 5060 Ti 8G(8 GB)。 在本站有该档位公开困惑度数据的 79 个模型中,相对 FP16 的损失中位数为 2.9%。

MXFP4 是 GGUF 的一个档位,不是另一种格式

本站有 2 个模型的权重是以 4-bit 发布的,而不是从更高精度转换下来的,以 GGUF 形式分发,每权重 4.25 比特。这也是格式筛选器里找不到 MXFP4 的原因:它是这个容器内部的量化方案,不是另一种容器,你下载到的就是 GGUF 文件。这同时意味着没有一个 FP16 原版可以拿来计算困惑度损失 —— 发布出来的检查点本身就是量化后的 —— 而把它再量化成 Q4_K_M 只会损失质量,省不下显存。

本索引收录的 GGUF 档位

档位每权重比特模型数损失中位数
Q4_K_M4.1–4.9812.9%79 个样本的中位数
Q8_05.1–8.51200.3%19 个样本的中位数
Q5_K_M5.68–5.71171.3%16 个样本的中位数
Q3_K_M3.87165.4%16 个样本的中位数
Q6_K6.56100.8%10 个样本的中位数
Q2_K2.63248.5%2 个样本的中位数
MXFP44.2520.0%2 个样本的中位数

每权重比特取自模型自己的数据行,因此出现区间说明不同模型在同一档位下的实际大小略有差异。损失中位数只统计该档位有公开困惑度数据的模型,样本量标在旁边。

本索引中提供 GGUF 的模型

81 个中的 81 个,按参数量从大到小排列,各自标出最小的 GGUF 档位,以及该档位已公开的困惑度损失(若有)。

浏览 GGUF 模型

常见问题

GGUF 是什么?

最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。 它由 llama.cpp · Ollama 读取,硬件要求为 Any — CPU / NVIDIA / AMD / Apple,本索引 81 个模型中有 81 个提供该格式。

Llama 3.1 8B Instruct 用 GGUF 需要多少显存?

在 Q4_K_M、4K 上下文下约 5.6 GB,其中权重本身占 4.6 GB,因此 8 GB 的显卡可以从容运行。上下文更长会额外增加 KV 缓存;计算器可以算任意组合。

GGUF 该下载哪个档位?

本索引收录了 Q4_K_M(81 个模型)、Q8_0(20 个模型)、Q5_K_M(17 个模型)、Q3_K_M(16 个模型)、Q6_K(10 个模型)、Q2_K(2 个模型)、MXFP4(2 个模型)。Q4_K_M 是最多模型提供的档位,通常也是起点。最小的是 Q2_K(2.63 bpw),最大的是 Q8_0(8.51 bpw)—— 真正的原则是:在显卡仍有余量的前提下取最高档位,而不是取「能加载的最小档位」。

该用 GGUF 还是别的格式?

取决于你用什么来跑:这个格式的位置是「本地 / 端侧部署」。本站把它与 AWQ、EXL2、GPTQ 做了直接对比,且只用同时提供两种格式的模型 —— 只有那里的对比是可测量的,而不是编辑观点。

GGUF 与其他格式的对比