AWQ 与 EXL2 该选哪个量化格式?
从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。
速览
| AWQ | EXL2 | |
|---|---|---|
| 可运行于 | NVIDIA GPU (CUDA 11.8+) | NVIDIA GPU (Ampere+ recommended) |
| 运行时 | vLLM · AutoAWQ · TGI | ExLlamaV2 · TabbyAPI |
| 最适合 | 高吞吐 API 服务端 | 单卡极致性能 |
| 采用率估算 | 45% | 32% |
| 本索引中的模型数 | 53 / 79 | 21 / 79 |
AWQ
激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。
优势
- 4-bit 精度最高
- vLLM 下速度极快
- 批量推理吞吐出色
取舍
- 仅限 NVIDIA
- 配置比 GGUF 复杂
EXL2
ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。
优势
- GPU 推理速度最快
- 每比特精度最优
- 超低 2bpw 选项
取舍
- 仅限 NVIDIA
- 学习曲线较陡
两种格式都提供的模型
这 16 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。
| 模型 | AWQ 档位 | 质量损失 | EXL2 档位 | 质量损失 |
|---|---|---|---|---|
| Qwen2.5 72B Instruct | AWQ INT4 | 3.5% | EXL2 3.5bpw | 4.8% |
| Llama 3.1 70B Instruct | AWQ INT4 | 3.9% | EXL2 3.5bpw | 5.2% |
| Qwen3 32B Instruct | AWQ INT4 | 3.6% | EXL2 3.5bpw | 4.5% |
| Qwen2.5-Coder 32B Instruct | AWQ INT4 | 3.5% | EXL2 3.5bpw | 4.5% |
| Mistral Small 24B Instruct | AWQ INT4 | 3.8% | EXL2 4.65bpw | 2.2% |
| Devstral Small 1.1 24B | AWQ INT4 | 4% | EXL2 4.65bpw | 2.5% |
| Magistral Small 1.2 24B | AWQ INT4 | 4% | EXL2 4.65bpw | 2.5% |
| Qwen3 14B Instruct | AWQ INT4 | 3.5% | EXL2 4.65bpw | 1.8% |
| Qwen2.5 14B Instruct | AWQ INT4 | 3.8% | EXL2 4.65bpw | 2.1% |
| DeepSeek-R1-Distill-Qwen-14B | AWQ INT4 | 3.6% | EXL2 4.65bpw | 2% |
| Qwen3 8B Instruct | AWQ INT4 | 3.8% | EXL2 4.65bpw | 2% |
| Llama 3.1 8B Instruct | AWQ INT4 | 4.5% | EXL2 4.65bpw | 2.5% |
| DeepSeek-R1-Distill-Llama-8B | AWQ INT4 | 3.5% | EXL2 4.65bpw | 1.9% |
| Qwen2.5 7B Instruct | AWQ INT4 | 4.2% | EXL2 4.65bpw | 2.2% |
| Qwen2.5-Coder 7B Instruct | AWQ INT4 | 4% | EXL2 4.65bpw | 2% |
| Qwen3 4B Instruct | AWQ INT4 | 3.8% | EXL2 4.65bpw | 2.1% |
质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。