GGUF 与 EXL2 该选哪个量化格式?

从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。

速览

GGUF 与 EXL2 该选哪个量化格式?
GGUFEXL2
可运行于Any — CPU / NVIDIA / AMD / AppleNVIDIA GPU (Ampere+ recommended)
运行时llama.cpp · OllamaExLlamaV2 · TabbyAPI
最适合本地 / 端侧部署单卡极致性能
采用率估算89%32%
本索引中的模型数79 / 7921 / 79

GGUF

最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。

优势

  • 兼容任意硬件
  • CPU+GPU 混合推理
  • 生态最完善
  • 上手极简

取舍

  • 慢于 GPU 原生格式
  • 高并发场景非最优

EXL2

ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。

优势

  • GPU 推理速度最快
  • 每比特精度最优
  • 超低 2bpw 选项

取舍

  • 仅限 NVIDIA
  • 学习曲线较陡

两种格式都提供的模型

这 21 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。

两种格式都提供的模型
模型GGUF 档位质量损失EXL2 档位质量损失
Qwen2.5 72B InstructQ5_K_M1.1%EXL2 3.5bpw4.8%
Llama 3.1 70B InstructQ5_K_M1.2%EXL2 3.5bpw5.2%
Qwen3 32B InstructQ4_K_M2.5%EXL2 3.5bpw4.5%
Qwen2.5 32B InstructQ4_K_M2.7%EXL2 3.5bpw4.8%
Qwen2.5-Coder 32B InstructQ4_K_M2.5%EXL2 3.5bpw4.5%
DeepSeek-R1-Distill-Qwen-32BQ4_K_M2.6%EXL2 3.5bpw4.5%
Mistral Small 24B InstructQ4_K_M2.9%EXL2 4.65bpw2.2%
Devstral Small 1.1 24BQ6_K0.6%EXL2 4.65bpw2.5%
Magistral Small 1.2 24BQ6_K0.6%EXL2 4.65bpw2.5%
Qwen3 14B InstructQ5_K_M1.2%EXL2 4.65bpw1.8%
Qwen2.5 14B InstructQ5_K_M1.4%EXL2 4.65bpw2.1%
DeepSeek-R1-Distill-Qwen-14BQ4_K_M2.8%EXL2 4.65bpw2%
Qwen3 8B InstructQ6_K0.6%EXL2 4.65bpw2%
Llama 3.1 8B InstructQ8_00.1%EXL2 4.65bpw2.5%
Nous Hermes 3 Llama 3.1 8BQ4_K_M3%EXL2 4.65bpw2.3%
OpenChat 3.6 8BQ4_K_M3.1%EXL2 4.65bpw2.4%
DeepSeek-R1-Distill-Llama-8BQ5_K_M1.2%EXL2 4.65bpw1.9%
Qwen2.5 7B InstructQ6_K0.7%EXL2 4.65bpw2.2%
Qwen2.5-Coder 7B InstructQ4_K_M2.8%EXL2 4.65bpw2%
DeepSeek-R1-Distill-Qwen-7BQ4_K_M3%EXL2 4.65bpw2.2%

质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。

该选哪个