EXL2 与 GPTQ 该选哪个量化格式?
从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。
速览
| EXL2 | GPTQ | |
|---|---|---|
| 可运行于 | NVIDIA GPU (Ampere+ recommended) | NVIDIA GPU (CUDA) |
| 运行时 | ExLlamaV2 · TabbyAPI | auto-gptq · vLLM · TGI |
| 最适合 | 单卡极致性能 | 既有服务端部署 |
| 采用率估算 | 32% | 28% |
| 本索引中的模型数 | 21 / 79 | 4 / 79 |
EXL2
ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。
优势
- GPU 推理速度最快
- 每比特精度最优
- 超低 2bpw 选项
取舍
- 仅限 NVIDIA
- 学习曲线较陡
GPTQ
最早普及的训练后量化格式之一,框架兼容性广,新模型正逐渐被 AWQ 取代。
优势
- 框架兼容性广
- 生态成熟
- 支持 HF Transformers
取舍
- 量化过程较慢
- 精度低于 AWQ
两种格式都提供的模型
本索引中没有模型同时提供这两种格式,因此无法给出同模型对照行。上方对比属于编辑判断。