AWQ 详解
AWQ 是什么、哪些运行时能读它、显存开销如何,以及本索引 81 个模型中提供该格式的全部 53 个。
AWQ 是什么
激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。 本索引的 81 个模型中有 53 个提供该格式,共 1 个量化档位 —— INT4。
什么运行时能读它
vLLM · AutoAWQ · TGI。硬件要求:NVIDIA GPU (CUDA 11.8+)。最擅长的场景:高吞吐 API 服务端。强项:4-bit 精度最高;vLLM 下速度极快;批量推理吞吐出色。短板:仅限 NVIDIA;配置比 GGUF 复杂。
它要多少显存
Llama 3.1 8B Instruct 在 AWQ INT4 下为每权重 4 比特,折合权重 3.8 GB,加上 4K 上下文的 KV 缓存 0.5 GB 与激活缓冲 0.4 GB —— 合计 4.8 GB;本索引中能从容装下它的最小显卡是 RTX 5060 Ti 8G(8 GB)。 在本站有该档位公开困惑度数据的 53 个模型中,相对 FP16 的损失中位数为 4.0%。
本索引收录的 AWQ 档位
| 档位 | 每权重比特 | 模型数 | 损失中位数 |
|---|---|---|---|
| INT4 | 4 | 53 | 4.0%53 个样本的中位数 |
每权重比特取自模型自己的数据行,因此出现区间说明不同模型在同一档位下的实际大小略有差异。损失中位数只统计该档位有公开困惑度数据的模型,样本量标在旁边。
本索引中提供 AWQ 的模型
81 个中的 53 个,按参数量从大到小排列,各自标出最小的 AWQ 档位,以及该档位已公开的困惑度损失(若有)。
- Llama 3.1 405B Instruct405B · INT4 · 3.5%
- Qwen3 235B-A22B Instruct235B-A22B · INT4 · 3.2%
- Llama 4 Scout 17B (16E)109B MoE · INT4 · 3.2%
- Qwen2.5 72B Instruct72B · INT4 · 3.5%
- Llama 3.1 70B Instruct70B · INT4 · 3.9%
- Llama 3.3 70B Instruct70B · INT4 · 3.7%
- DeepSeek-R1-Distill-Llama-70B70B · INT4 · 3.5%
- Mixtral 8x7B Instruct47B MoE · INT4 · 3.8%
- Seed-OSS 36B Instruct36B · INT4 · 3.8%
- Yi 1.5 34B Chat34B · INT4 · 4.0%
- Qwen3 32B Instruct32B · INT4 · 3.6%
- Qwen2.5-Coder 32B Instruct32B · INT4 · 3.5%
- Qwen3 30B-A3B Instruct30B-A3B · INT4 · 3.4%
- Qwen3-Coder 30B-A3B Instruct30B-A3B · INT4 · 3.2%
- Qwen3-VL 30B-A3B Instruct30B-A3B · INT4 · 3.7%
- Gemma 3 27B IT27B · INT4 · 3.8%
- Gemma 2 27B Instruct27B · INT4 · 4.0%
- Mistral Small 24B Instruct24B · INT4 · 3.8%
- Devstral Small 1.1 24B24B · INT4 · 4.0%
- Magistral Small 1.2 24B24B · INT4 · 4.0%
- Codestral 22B22B · INT4 · 4.2%
- DeepSeek-Coder-V2-Lite Instruct16B · INT4 · 4.1%
- DeepSeek-V2-Lite Chat16B · INT4 · 4.0%
- Qwen3 14B Instruct14B · INT4 · 3.5%
- Qwen2.5 14B Instruct14B · INT4 · 3.8%
- DeepSeek-R1-Distill-Qwen-14B14B · INT4 · 3.6%
- Phi-4 14B14B · INT4 · 3.6%
- Phi-3 Medium 14B Instruct14B · INT4 · 4.2%
- Mistral Nemo 12B Instruct12B · INT4 · 4.4%
- Gemma 3 12B IT12B · INT4 · 3.9%
- Stable LM 2 12B Chat12B · INT4 · 4.5%
- Jamba 1.5 Mini12B · INT4 · 4.8%
- Solar 10.7B Instruct11B · INT4 · 4.2%
- Gemma 2 9B Instruct9B · INT4 · 4.6%
- GLM-4-9B-Chat9B · INT4 · 4.2%
- Qwen3-VL 8B Instruct8B · INT4 · 4.2%
- Qwen2-VL 7B Instruct7B · INT4 · 5.0%
- Qwen3 8B Instruct8B · INT4 · 3.8%
- Llama 3.1 8B Instruct8B · INT4 · 4.5%
- Aya 23 8B8B · INT4 · 4.6%
- DeepSeek-R1-Distill-Llama-8B8B · INT4 · 3.5%
- InternLM2 7B Chat7B · INT4 · 4.3%
- Qwen2.5 7B Instruct7B · INT4 · 4.2%
- Qwen2.5-Coder 7B Instruct7B · INT4 · 4.0%
- WizardLM-2 7B7B · INT4 · 4.3%
- Mistral 7B Instruct v0.37B · INT4 · 4.5%
- Gemma 3 4B IT4B · INT4 · 4.2%
- Qwen3 4B Instruct4B · INT4 · 3.8%
- Phi-4 Mini Instruct3.8B · INT4 · 4.8%
- Phi-3.5 Mini Instruct3.8B · INT4 · 5.1%
- Llama 3.2 3B Instruct3B · INT4 · 4.8%
- Gemma 2 2B Instruct2B · INT4 · 5.0%
- Qwen3 1.7B Instruct1.7B · INT4 · 4.0%
常见问题
AWQ 是什么?
激活感知权重量化,高精度 INT4,专为 NVIDIA GPU 优化,与 vLLM 搭配是服务端最优解。 它由 vLLM · AutoAWQ · TGI 读取,硬件要求为 NVIDIA GPU (CUDA 11.8+),本索引 81 个模型中有 53 个提供该格式。
Llama 3.1 8B Instruct 用 AWQ 需要多少显存?
在 AWQ INT4、4K 上下文下约 4.8 GB,其中权重本身占 3.8 GB,因此 8 GB 的显卡可以从容运行。上下文更长会额外增加 KV 缓存;计算器可以算任意组合。
该用 AWQ 还是别的格式?
取决于你用什么来跑:这个格式的位置是「高吞吐 API 服务端」。本站把它与 GGUF、EXL2 做了直接对比,且只用同时提供两种格式的模型 —— 只有那里的对比是可测量的,而不是编辑观点。