GGUF 与 GPTQ 该选哪个量化格式?

从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。

速览

GGUF 与 GPTQ 该选哪个量化格式?
GGUFGPTQ
可运行于Any — CPU / NVIDIA / AMD / AppleNVIDIA GPU (CUDA)
运行时llama.cpp · Ollamaauto-gptq · vLLM · TGI
最适合本地 / 端侧部署既有服务端部署
采用率估算89%28%
本索引中的模型数79 / 794 / 79

GGUF

最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。

优势

  • 兼容任意硬件
  • CPU+GPU 混合推理
  • 生态最完善
  • 上手极简

取舍

  • 慢于 GPU 原生格式
  • 高并发场景非最优

GPTQ

最早普及的训练后量化格式之一,框架兼容性广,新模型正逐渐被 AWQ 取代。

优势

  • 框架兼容性广
  • 生态成熟
  • 支持 HF Transformers

取舍

  • 量化过程较慢
  • 精度低于 AWQ

两种格式都提供的模型

这 4 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。

两种格式都提供的模型
模型GGUF 档位质量损失GPTQ 档位质量损失
Command R 35BQ4_K_M3%GPTQ INT44.5%
StarCoder2 15BQ4_K_M3.2%GPTQ INT44.8%
Falcon 3 10B InstructQ4_K_M3.1%GPTQ INT44.8%
Granite 3.1 8B InstructQ4_K_M3%GPTQ INT44.5%

质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。

该选哪个