GGUF 与 AWQ 该选哪个量化格式?

从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。

速览

GGUF 与 AWQ 该选哪个量化格式?
GGUFAWQ
可运行于Any — CPU / NVIDIA / AMD / AppleNVIDIA GPU (CUDA 11.8+)
运行时llama.cpp · OllamavLLM · AutoAWQ · TGI
最适合本地 / 端侧部署高吞吐 API 服务端
采用率估算89%45%
本索引中的模型数79 / 7953 / 79

GGUF

最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。

优势

  • 兼容任意硬件
  • CPU+GPU 混合推理
  • 生态最完善
  • 上手极简

取舍

  • 慢于 GPU 原生格式
  • 高并发场景非最优

AWQ

激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。

优势

  • 4-bit 精度最高
  • vLLM 下速度极快
  • 批量推理吞吐出色

取舍

  • 仅限 NVIDIA
  • 配置比 GGUF 复杂

两种格式都提供的模型

这 53 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。

两种格式都提供的模型
模型GGUF 档位质量损失AWQ 档位质量损失
Llama 3.1 405B InstructQ4_K_M2.3%AWQ INT43.5%
Qwen3 235B-A22B InstructQ4_K_M2.2%AWQ INT43.2%
Llama 4 Scout 17B (16E)Q4_K_M2.4%AWQ INT43.2%
Qwen2.5 72B InstructQ5_K_M1.1%AWQ INT43.5%
Llama 3.1 70B InstructQ5_K_M1.2%AWQ INT43.9%
Llama 3.3 70B InstructQ5_K_M1%AWQ INT43.7%
DeepSeek-R1-Distill-Llama-70BQ4_K_M2.4%AWQ INT43.5%
Mixtral 8x7B InstructQ4_K_M2.8%AWQ INT43.8%
Seed-OSS 36B InstructQ5_K_M1.3%AWQ INT43.8%
Yi 1.5 34B ChatQ4_K_M2.8%AWQ INT44%
Qwen3 32B InstructQ4_K_M2.5%AWQ INT43.6%
Qwen2.5-Coder 32B InstructQ4_K_M2.5%AWQ INT43.5%
Qwen3 30B-A3B InstructQ5_K_M1.1%AWQ INT43.4%
Qwen3-Coder 30B-A3B InstructQ5_K_M1%AWQ INT43.2%
Qwen3-VL 30B-A3B InstructQ8_00.3%AWQ INT43.7%
Gemma 3 27B ITQ4_K_M2.8%AWQ INT43.8%
Gemma 2 27B InstructQ5_K_M1.3%AWQ INT44%
Mistral Small 24B InstructQ4_K_M2.9%AWQ INT43.8%
Devstral Small 1.1 24BQ6_K0.6%AWQ INT44%
Magistral Small 1.2 24BQ6_K0.6%AWQ INT44%

质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。

该选哪个