Qwen2.5 72B Instruct

72B

Alibaba Qwen2.5

Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。

3.0K HF 下载量46 点赞Qwen/Qwen2.5-72B-Instruct-GGUF· 数据更新于 8/14/2026
专业 GPU

131K

最大上下文

4

量化变体

GGUF Q5_K_M

最佳质量

98.9%

精度保留率

量化变体对比

各量化级别的显存、质量损失及 RTX 4090 推理速度

实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告

格式级别BPW显存PPL 损失速度来源操作
GGUFQ4_K_M4.8543.6 GB2.5%28 tok/s估算
计算HF
GGUFQ5_K_M5.6850.1 GB1.1%24 tok/s估算
计算HF
AWQINT4438.5 GB3.5%42 tok/s估算
计算HF
EXL23.5bpw3.533.8 GB4.8%48 tok/s估算
计算HF