AWQ 与 EXL2 该选哪个量化格式?

从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。

速览

AWQ 与 EXL2 该选哪个量化格式?
AWQEXL2
可运行于NVIDIA GPU (CUDA 11.8+)NVIDIA GPU (Ampere+ recommended)
运行时vLLM · AutoAWQ · TGIExLlamaV2 · TabbyAPI
最适合高吞吐 API 服务端单卡极致性能
采用率估算45%32%
本索引中的模型数53 / 7921 / 79

AWQ

激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。

优势

  • 4-bit 精度最高
  • vLLM 下速度极快
  • 批量推理吞吐出色

取舍

  • 仅限 NVIDIA
  • 配置比 GGUF 复杂

EXL2

ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。

优势

  • GPU 推理速度最快
  • 每比特精度最优
  • 超低 2bpw 选项

取舍

  • 仅限 NVIDIA
  • 学习曲线较陡

两种格式都提供的模型

这 16 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。

两种格式都提供的模型
模型AWQ 档位质量损失EXL2 档位质量损失
Qwen2.5 72B InstructAWQ INT43.5%EXL2 3.5bpw4.8%
Llama 3.1 70B InstructAWQ INT43.9%EXL2 3.5bpw5.2%
Qwen3 32B InstructAWQ INT43.6%EXL2 3.5bpw4.5%
Qwen2.5-Coder 32B InstructAWQ INT43.5%EXL2 3.5bpw4.5%
Mistral Small 24B InstructAWQ INT43.8%EXL2 4.65bpw2.2%
Devstral Small 1.1 24BAWQ INT44%EXL2 4.65bpw2.5%
Magistral Small 1.2 24BAWQ INT44%EXL2 4.65bpw2.5%
Qwen3 14B InstructAWQ INT43.5%EXL2 4.65bpw1.8%
Qwen2.5 14B InstructAWQ INT43.8%EXL2 4.65bpw2.1%
DeepSeek-R1-Distill-Qwen-14BAWQ INT43.6%EXL2 4.65bpw2%
Qwen3 8B InstructAWQ INT43.8%EXL2 4.65bpw2%
Llama 3.1 8B InstructAWQ INT44.5%EXL2 4.65bpw2.5%
DeepSeek-R1-Distill-Llama-8BAWQ INT43.5%EXL2 4.65bpw1.9%
Qwen2.5 7B InstructAWQ INT44.2%EXL2 4.65bpw2.2%
Qwen2.5-Coder 7B InstructAWQ INT44%EXL2 4.65bpw2%
Qwen3 4B InstructAWQ INT43.8%EXL2 4.65bpw2.1%

质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。

该选哪个