GGUF 详解
GGUF 是什么、哪些运行时能读它、显存开销如何,以及本索引 81 个模型中提供该格式的全部 81 个。
GGUF 是什么
最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。 本索引的 81 个模型中有 81 个提供该格式,共 7 个量化档位 —— Q4_K_M、Q8_0、Q5_K_M、Q3_K_M、Q6_K、Q2_K、MXFP4。
什么运行时能读它
llama.cpp · Ollama。硬件要求:Any — CPU / NVIDIA / AMD / Apple。最擅长的场景:本地 / 端侧部署。强项:兼容任意硬件;CPU+GPU 混合推理;生态最完善;上手极简。短板:慢于 GPU 原生格式;高并发场景非最优。
它要多少显存
Llama 3.1 8B Instruct 在 Q4_K_M 下为每权重 4.85 比特,折合权重 4.6 GB,加上 4K 上下文的 KV 缓存 0.5 GB 与激活缓冲 0.5 GB —— 合计 5.6 GB;本索引中能从容装下它的最小显卡是 RTX 5060 Ti 8G(8 GB)。 在本站有该档位公开困惑度数据的 79 个模型中,相对 FP16 的损失中位数为 2.9%。
MXFP4 是 GGUF 的一个档位,不是另一种格式
本站有 2 个模型的权重是以 4-bit 发布的,而不是从更高精度转换下来的,以 GGUF 形式分发,每权重 4.25 比特。这也是格式筛选器里找不到 MXFP4 的原因:它是这个容器内部的量化方案,不是另一种容器,你下载到的就是 GGUF 文件。这同时意味着没有一个 FP16 原版可以拿来计算困惑度损失 —— 发布出来的检查点本身就是量化后的 —— 而把它再量化成 Q4_K_M 只会损失质量,省不下显存。
本索引收录的 GGUF 档位
| 档位 | 每权重比特 | 模型数 | 损失中位数 |
|---|---|---|---|
| Q4_K_M | 4.1–4.9 | 81 | 2.9%79 个样本的中位数 |
| Q8_0 | 5.1–8.51 | 20 | 0.3%19 个样本的中位数 |
| Q5_K_M | 5.68–5.71 | 17 | 1.3%16 个样本的中位数 |
| Q3_K_M | 3.87 | 16 | 5.4%16 个样本的中位数 |
| Q6_K | 6.56 | 10 | 0.8%10 个样本的中位数 |
| Q2_K | 2.63 | 2 | 48.5%2 个样本的中位数 |
| MXFP4 | 4.25 | 2 | 0.0%2 个样本的中位数 |
每权重比特取自模型自己的数据行,因此出现区间说明不同模型在同一档位下的实际大小略有差异。损失中位数只统计该档位有公开困惑度数据的模型,样本量标在旁边。
本索引中提供 GGUF 的模型
81 个中的 81 个,按参数量从大到小排列,各自标出最小的 GGUF 档位,以及该档位已公开的困惑度损失(若有)。
- Mistral Large 3 675B Instruct675B MoE · Q3_K_M · 4.5%
- DeepSeek-V3671B MoE · Q3_K_M · 4.5%
- DeepSeek-R1671B MoE · Q3_K_M · 4.2%
- Llama 3.1 405B Instruct405B · Q3_K_M · 5.0%
- Llama 4 Maverick 17B (128E)400B MoE · Q3_K_M · 4.5%
- Qwen3 235B-A22B Instruct235B-A22B · Q3_K_M · 4.8%
- DBRX Instruct132B · Q3_K_M · 5.8%
- GPT-OSS 120B117B MoE · Q4_K_M · 1.6%
- Llama 4 Scout 17B (16E)109B MoE · Q3_K_M · 4.8%
- GLM-4.5-Air106B MoE · Q2_K · 12.0%
- Llama 3.2 90B Vision Instruct90B · Q3_K_M · 6.5%
- Qwen2.5 72B Instruct72B · Q4_K_M · 2.5%
- Llama 3.1 70B Instruct70B · Q4_K_M · 2.8%
- Llama 3.3 70B Instruct70B · Q4_K_M · 2.6%
- DeepSeek-R1-Distill-Llama-70B70B · Q4_K_M · 2.4%
- Mixtral 8x7B Instruct47B MoE · Q4_K_M · 2.8%
- Seed-OSS 36B Instruct36B · Q3_K_M · 5.6%
- Command R 35B35B · Q4_K_M · 3.0%
- Yi 1.5 34B Chat34B · Q4_K_M · 2.8%
- Qwen3 32B Instruct32B · Q3_K_M · 7.2%
- Qwen2.5 32B Instruct32B · Q3_K_M · 7.8%
- Qwen2.5-Coder 32B Instruct32B · Q4_K_M · 2.5%
- DeepSeek-R1-Distill-Qwen-32B32B · Q3_K_M · 7.2%
- Qwen3 30B-A3B Instruct30B-A3B · Q4_K_M · 2.4%
- Qwen3-Coder 30B-A3B Instruct30B-A3B · Q4_K_M · 2.3%
- Qwen3-VL 30B-A3B Instruct30B-A3B · Q3_K_M · 5.4%
- Qwen3.8 27B27B · Q4_K_M · —
- Gemma 3 27B IT27B · Q3_K_M · 5.5%
- Gemma 2 27B Instruct27B · Q4_K_M · 2.9%
- Mistral Small 24B Instruct24B · Q4_K_M · 2.9%
- Devstral Small 1.1 24B24B · Q4_K_M · 2.9%
- Magistral Small 1.2 24B24B · Q4_K_M · 2.9%
- Codestral 22B22B · Q4_K_M · 3.0%
- GPT-OSS 20B21B MoE · Q4_K_M · 1.4%
- InternLM2 20B Chat20B · Q4_K_M · 2.9%
- DeepSeek-Coder-V2-Lite Instruct16B · Q4_K_M · 3.1%
- DeepSeek-V2-Lite Chat16B · Q4_K_M · 3.0%
- StarCoder2 15B15B · Q4_K_M · 3.2%
- Qwen3 14B Instruct14B · Q4_K_M · 2.6%
- Qwen2.5 14B Instruct14B · Q4_K_M · 2.9%
- DeepSeek-R1-Distill-Qwen-14B14B · Q4_K_M · 2.8%
- Phi-4 14B14B · Q4_K_M · 2.7%
- Phi-3 Medium 14B Instruct14B · Q4_K_M · 3.0%
- Mistral Nemo 12B Instruct12B · Q4_K_M · 3.1%
- Gemma 3 12B IT12B · Q4_K_M · 2.9%
- Stable LM 2 12B Chat12B · Q4_K_M · 3.2%
- Jamba 1.5 Mini12B · Q4_K_M · 3.4%
- Llama 3.2 11B Vision Instruct11B · Q4_K_M · 3.5%
- Solar 10.7B Instruct11B · Q4_K_M · 3.0%
- Falcon 3 10B Instruct10B · Q4_K_M · 3.1%
- Gemma 2 9B Instruct9B · Q4_K_M · 3.3%
- GLM-4-9B-Chat9B · Q4_K_M · 3.0%
- Qwen3-VL 8B Instruct8B · Q4_K_M · 3.0%
- Ministral 3 8B Instruct8B · Q4_K_M · —
- Qwen2-VL 7B Instruct7B · Q4_K_M · 3.8%
- Granite 3.1 8B Instruct8B · Q4_K_M · 3.0%
- Qwen3 8B Instruct8B · Q4_K_M · 2.8%
- Llama 3.1 8B Instruct8B · Q2_K · 48.5%
- Nous Hermes 3 Llama 3.1 8B8B · Q4_K_M · 3.0%
- Aya 23 8B8B · Q4_K_M · 3.2%
- OpenChat 3.6 8B8B · Q4_K_M · 3.1%
- DeepSeek-R1-Distill-Llama-8B8B · Q4_K_M · 2.6%
- InternLM2 7B Chat7B · Q4_K_M · 3.1%
- Qwen2.5 7B Instruct7B · Q4_K_M · 3.0%
- Qwen2.5-Coder 7B Instruct7B · Q4_K_M · 2.8%
- WizardLM-2 7B7B · Q4_K_M · 3.1%
- DeepSeek-R1-Distill-Qwen-7B7B · Q4_K_M · 3.0%
- OLMo 2 7B Instruct7B · Q4_K_M · 3.4%
- Mistral 7B Instruct v0.37B · Q4_K_M · 3.2%
- Zephyr 7B Beta7B · Q4_K_M · 3.3%
- Gemma 3 4B IT4B · Q4_K_M · 3.2%
- Qwen3 4B Instruct4B · Q4_K_M · 2.9%
- Phi-4 Mini Instruct3.8B · Q4_K_M · 3.5%
- Phi-3.5 Mini Instruct3.8B · Q4_K_M · 3.8%
- Llama 3.2 3B Instruct3B · Q4_K_M · 3.5%
- Qwen2.5 3B Instruct3B · Q4_K_M · 3.2%
- Gemma 2 2B Instruct2B · Q4_K_M · 3.8%
- Qwen3 1.7B Instruct1.7B · Q4_K_M · 3.0%
- Qwen2.5 1.5B Instruct1.5B · Q4_K_M · 4.0%
- Llama 3.2 1B Instruct1B · Q4_K_M · 4.2%
- Qwen2.5 0.5B Instruct0.5B · Q4_K_M · 5.2%
常见问题
GGUF 是什么?
最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。 它由 llama.cpp · Ollama 读取,硬件要求为 Any — CPU / NVIDIA / AMD / Apple,本索引 81 个模型中有 81 个提供该格式。
Llama 3.1 8B Instruct 用 GGUF 需要多少显存?
在 Q4_K_M、4K 上下文下约 5.6 GB,其中权重本身占 4.6 GB,因此 8 GB 的显卡可以从容运行。上下文更长会额外增加 KV 缓存;计算器可以算任意组合。
GGUF 该下载哪个档位?
本索引收录了 Q4_K_M(81 个模型)、Q8_0(20 个模型)、Q5_K_M(17 个模型)、Q3_K_M(16 个模型)、Q6_K(10 个模型)、Q2_K(2 个模型)、MXFP4(2 个模型)。Q4_K_M 是最多模型提供的档位,通常也是起点。最小的是 Q2_K(2.63 bpw),最大的是 Q8_0(8.51 bpw)—— 真正的原则是:在显卡仍有余量的前提下取最高档位,而不是取「能加载的最小档位」。
该用 GGUF 还是别的格式?
取决于你用什么来跑:这个格式的位置是「本地 / 端侧部署」。本站把它与 AWQ、EXL2、GPTQ 做了直接对比,且只用同时提供两种格式的模型 —— 只有那里的对比是可测量的,而不是编辑观点。