EXL2 与 GPTQ 该选哪个量化格式?

从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。

速览

EXL2 与 GPTQ 该选哪个量化格式?
EXL2GPTQ
可运行于NVIDIA GPU (Ampere+ recommended)NVIDIA GPU (CUDA)
运行时ExLlamaV2 · TabbyAPIauto-gptq · vLLM · TGI
最适合单卡极致性能既有服务端部署
采用率估算32%28%
本索引中的模型数21 / 794 / 79

EXL2

ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。

优势

  • GPU 推理速度最快
  • 每比特精度最优
  • 超低 2bpw 选项

取舍

  • 仅限 NVIDIA
  • 学习曲线较陡

GPTQ

最早普及的训练后量化格式之一,框架兼容性广,新模型正逐渐被 AWQ 取代。

优势

  • 框架兼容性广
  • 生态成熟
  • 支持 HF Transformers

取舍

  • 量化过程较慢
  • 精度低于 AWQ

两种格式都提供的模型

本索引中没有模型同时提供这两种格式,因此无法给出同模型对照行。上方对比属于编辑判断。

该选哪个