GGUF 与 AWQ 该选哪个量化格式?
从硬件支持、运行时、质量,以及 79 个模型的索引中实际提供的情况来对比。
速览
| GGUF | AWQ | |
|---|---|---|
| 可运行于 | Any — CPU / NVIDIA / AMD / Apple | NVIDIA GPU (CUDA 11.8+) |
| 运行时 | llama.cpp · Ollama | vLLM · AutoAWQ · TGI |
| 最适合 | 本地 / 端侧部署 | 高吞吐 API 服务端 |
| 采用率估算 | 89% | 45% |
| 本索引中的模型数 | 79 / 79 | 53 / 79 |
GGUF
最通用的量化格式,CPU、GPU、苹果芯片全兼容。支持跨内存和显存混合推理。
优势
- 兼容任意硬件
- CPU+GPU 混合推理
- 生态最完善
- 上手极简
取舍
- 慢于 GPU 原生格式
- 高并发场景非最优
AWQ
激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。
优势
- 4-bit 精度最高
- vLLM 下速度极快
- 批量推理吞吐出色
取舍
- 仅限 NVIDIA
- 配置比 GGUF 复杂
两种格式都提供的模型
这 53 个模型同时发布了两种格式的权重,因此两行描述的是同一个模型而非两个不同模型 —— 这是本对比中唯一可测量、而非编辑判断的部分。
| 模型 | GGUF 档位 | 质量损失 | AWQ 档位 | 质量损失 |
|---|---|---|---|---|
| Llama 3.1 405B Instruct | Q4_K_M | 2.3% | AWQ INT4 | 3.5% |
| Qwen3 235B-A22B Instruct | Q4_K_M | 2.2% | AWQ INT4 | 3.2% |
| Llama 4 Scout 17B (16E) | Q4_K_M | 2.4% | AWQ INT4 | 3.2% |
| Qwen2.5 72B Instruct | Q5_K_M | 1.1% | AWQ INT4 | 3.5% |
| Llama 3.1 70B Instruct | Q5_K_M | 1.2% | AWQ INT4 | 3.9% |
| Llama 3.3 70B Instruct | Q5_K_M | 1% | AWQ INT4 | 3.7% |
| DeepSeek-R1-Distill-Llama-70B | Q4_K_M | 2.4% | AWQ INT4 | 3.5% |
| Mixtral 8x7B Instruct | Q4_K_M | 2.8% | AWQ INT4 | 3.8% |
| Seed-OSS 36B Instruct | Q5_K_M | 1.3% | AWQ INT4 | 3.8% |
| Yi 1.5 34B Chat | Q4_K_M | 2.8% | AWQ INT4 | 4% |
| Qwen3 32B Instruct | Q4_K_M | 2.5% | AWQ INT4 | 3.6% |
| Qwen2.5-Coder 32B Instruct | Q4_K_M | 2.5% | AWQ INT4 | 3.5% |
| Qwen3 30B-A3B Instruct | Q5_K_M | 1.1% | AWQ INT4 | 3.4% |
| Qwen3-Coder 30B-A3B Instruct | Q5_K_M | 1% | AWQ INT4 | 3.2% |
| Qwen3-VL 30B-A3B Instruct | Q8_0 | 0.3% | AWQ INT4 | 3.7% |
| Gemma 3 27B IT | Q4_K_M | 2.8% | AWQ INT4 | 3.8% |
| Gemma 2 27B Instruct | Q5_K_M | 1.3% | AWQ INT4 | 4% |
| Mistral Small 24B Instruct | Q4_K_M | 2.9% | AWQ INT4 | 3.8% |
| Devstral Small 1.1 24B | Q6_K | 0.6% | AWQ INT4 | 4% |
| Magistral Small 1.2 24B | Q6_K | 0.6% | AWQ INT4 | 4% |
质量损失是相对未量化权重的困惑度上升 —— 越低越好,且只在同一模型内部可比。