GPTQ 详解
GPTQ 是什么、哪些运行时能读它、显存开销如何,以及本索引 81 个模型中提供该格式的全部 4 个。
GPTQ 是什么
最早普及的训练后量化格式之一,框架兼容性广,新模型正逐渐被 AWQ 取代。 本索引的 81 个模型中有 4 个提供该格式,共 1 个量化档位 —— INT4。 81 个里只有 4 个,是本站收录最少的格式;把它看作「你可能会遇到」的格式,而不是优先选择的格式。
什么运行时能读它
auto-gptq · vLLM · TGI。硬件要求:NVIDIA GPU (CUDA)。最擅长的场景:既有服务端部署。强项:框架兼容性广;生态成熟;支持 HF Transformers。短板:量化过程较慢;精度低于 AWQ。
它要多少显存
Granite 3.1 8B Instruct 在 GPTQ INT4 下为每权重 4 比特,折合权重 3.9 GB,加上 4K 上下文的 KV 缓存 0.6 GB 与激活缓冲 0.5 GB —— 合计 5.0 GB;本索引中能从容装下它的最小显卡是 RTX 5060 Ti 8G(8 GB)。 在本站有该档位公开困惑度数据的 4 个模型中,相对 FP16 的损失中位数为 4.8%。
本索引收录的 GPTQ 档位
| 档位 | 每权重比特 | 模型数 | 损失中位数 |
|---|---|---|---|
| INT4 | 4 | 4 | 4.8%4 个样本的中位数 |
每权重比特取自模型自己的数据行,因此出现区间说明不同模型在同一档位下的实际大小略有差异。损失中位数只统计该档位有公开困惑度数据的模型,样本量标在旁边。
本索引中提供 GPTQ 的模型
81 个中的 4 个,按参数量从大到小排列,各自标出最小的 GPTQ 档位,以及该档位已公开的困惑度损失(若有)。
- Command R 35B35B · INT4 · 4.5%
- StarCoder2 15B15B · INT4 · 4.8%
- Falcon 3 10B Instruct10B · INT4 · 4.8%
- Granite 3.1 8B Instruct8B · INT4 · 4.5%
常见问题
GPTQ 是什么?
最早普及的训练后量化格式之一,框架兼容性广,新模型正逐渐被 AWQ 取代。 它由 auto-gptq · vLLM · TGI 读取,硬件要求为 NVIDIA GPU (CUDA),本索引 81 个模型中有 4 个提供该格式。
Granite 3.1 8B Instruct 用 GPTQ 需要多少显存?
在 GPTQ INT4、4K 上下文下约 5.0 GB,其中权重本身占 3.9 GB,因此 8 GB 的显卡可以从容运行。上下文更长会额外增加 KV 缓存;计算器可以算任意组合。
2026 年还值得用 GPTQ 吗?
它仍然能用,auto-gptq 依然支持。但本站 81 个模型中只有 4 个提供它,而 GGUF 有 81 个 —— 这个比例就是诚实的答案:它处于维护状态,而非发展状态。本站把它与 GGUF 做了直接对比,且只用同时提供两种格式的模型 —— 只有那里的对比是可测量的,而不是编辑观点。