AWQ 与 GPTQ 该选哪个量化格式?

从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。

速览

AWQ 与 GPTQ 该选哪个量化格式?
AWQGPTQ
可运行于NVIDIA GPU (CUDA 11.8+)NVIDIA GPU (CUDA)
运行时vLLM · AutoAWQ · TGIauto-gptq · vLLM · TGI
最适合高吞吐 API 服务端既有服务端部署
采用率估算45%28%
本索引中的模型数53 / 794 / 79

AWQ

激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。

优势

  • 4-bit 精度最高
  • vLLM 下速度极快
  • 批量推理吞吐出色

取舍

  • 仅限 NVIDIA
  • 配置比 GGUF 复杂

GPTQ

最早普及的训练后量化格式之一,框架兼容性广,新模型正逐渐被 AWQ 取代。

优势

  • 框架兼容性广
  • 生态成熟
  • 支持 HF Transformers

取舍

  • 量化过程较慢
  • 精度低于 AWQ

两种格式都提供的模型

本索引中没有模型同时提供这两种格式,因此无法给出同模型对照行。上方对比属于编辑判断。

该选哪个