GGUF 与 EXL2 该选哪个量化格式?
从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。
速览
| GGUF | EXL2 | |
|---|---|---|
| 可运行于 | Any — CPU / NVIDIA / AMD / Apple | NVIDIA GPU (Ampere+ recommended) |
| 运行时 | llama.cpp · Ollama | ExLlamaV2 · TabbyAPI |
| 最适合 | 本地 / 端侧部署 | 单卡极致性能 |
| 采用率估算 | 89% | 32% |
| 本索引中的模型数 | 79 / 79 | 21 / 79 |
GGUF
最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。
优势
- 兼容任意硬件
- CPU+GPU 混合推理
- 生态最完善
- 上手极简
取舍
- 慢于 GPU 原生格式
- 高并发场景非最优
EXL2
ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。
优势
- GPU 推理速度最快
- 每比特精度最优
- 超低 2bpw 选项
取舍
- 仅限 NVIDIA
- 学习曲线较陡
两种格式都提供的模型
这 21 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。
| 模型 | GGUF 档位 | 质量损失 | EXL2 档位 | 质量损失 |
|---|---|---|---|---|
| Qwen2.5 72B Instruct | Q5_K_M | 1.1% | EXL2 3.5bpw | 4.8% |
| Llama 3.1 70B Instruct | Q5_K_M | 1.2% | EXL2 3.5bpw | 5.2% |
| Qwen3 32B Instruct | Q4_K_M | 2.5% | EXL2 3.5bpw | 4.5% |
| Qwen2.5 32B Instruct | Q4_K_M | 2.7% | EXL2 3.5bpw | 4.8% |
| Qwen2.5-Coder 32B Instruct | Q4_K_M | 2.5% | EXL2 3.5bpw | 4.5% |
| DeepSeek-R1-Distill-Qwen-32B | Q4_K_M | 2.6% | EXL2 3.5bpw | 4.5% |
| Mistral Small 24B Instruct | Q4_K_M | 2.9% | EXL2 4.65bpw | 2.2% |
| Devstral Small 1.1 24B | Q6_K | 0.6% | EXL2 4.65bpw | 2.5% |
| Magistral Small 1.2 24B | Q6_K | 0.6% | EXL2 4.65bpw | 2.5% |
| Qwen3 14B Instruct | Q5_K_M | 1.2% | EXL2 4.65bpw | 1.8% |
| Qwen2.5 14B Instruct | Q5_K_M | 1.4% | EXL2 4.65bpw | 2.1% |
| DeepSeek-R1-Distill-Qwen-14B | Q4_K_M | 2.8% | EXL2 4.65bpw | 2% |
| Qwen3 8B Instruct | Q6_K | 0.6% | EXL2 4.65bpw | 2% |
| Llama 3.1 8B Instruct | Q8_0 | 0.1% | EXL2 4.65bpw | 2.5% |
| Nous Hermes 3 Llama 3.1 8B | Q4_K_M | 3% | EXL2 4.65bpw | 2.3% |
| OpenChat 3.6 8B | Q4_K_M | 3.1% | EXL2 4.65bpw | 2.4% |
| DeepSeek-R1-Distill-Llama-8B | Q5_K_M | 1.2% | EXL2 4.65bpw | 1.9% |
| Qwen2.5 7B Instruct | Q6_K | 0.7% | EXL2 4.65bpw | 2.2% |
| Qwen2.5-Coder 7B Instruct | Q4_K_M | 2.8% | EXL2 4.65bpw | 2% |
| DeepSeek-R1-Distill-Qwen-7B | Q4_K_M | 3% | EXL2 4.65bpw | 2.2% |
质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。