基准测试与洞察

数据说话,拒绝炒作 — 真实硬件实测

下面每一行数据都产自本页描述的那台机器,不是从别处收集来的。这也意味着覆盖面很窄:在 GPU 索引的 76 张卡里,实测覆盖了 4 张,共 16 次运行。本站任何没有实测的数字都会标注为「预估」——而这一页,就是所有实测数字唯一的来源。

本页基准数据采用 CC BY 4.0 许可——可以自由复用,注明出处并链接到 quantized.uk 即可。

同样的数据,以文本呈现

图表由 SVG 路径绘制,其中的数字并不是可读文本。下面两张表提供相同的数据。

哪些有实测,哪些没有

仅有预估

索引里剩下的 76 张卡。它们的数字来自和显存计算器同一套公式,按公开的显存带宽换算得出——不是另一套隐藏的实测数据。

完全没覆盖

  • 双 RTX 3090 指南之外的多卡吞吐
  • 大于 1 的 batch size
  • 与生成速度分开的提示词处理(prefill)速度
  • 困惑度以外的任何质量指标

硬件 × 格式矩阵

多模型真实硬件速度与显存 — 可比量化级别横向对照

硬件 × 格式矩阵 — 多模型真实硬件速度与显存 — 可比量化级别横向对照
模型硬件框架量化级别速度 (tok/s)显存用量备注
Llama 3.1 8BRTX 4090 24GExLlamaV2EXL2 4.65bpw2355.4 GB消费级最快
Llama 3.1 8BRTX 4090 24GvLLMAWQ INT42184.9 GB批量 API 服务最佳
Llama 3.1 8BRTX 4090 24Gllama.cppGGUF Q4_K_M1485.7 GB部署最简单
Qwen2.5 7BRTX 4090 24Gllama.cppGGUF Q4_K_M1555.4 GB代码能力强;显存占用接近 8B
DeepSeek-R1 14BRTX 4090 24GExLlamaV2EXL2 4.65bpw1289.8 GB推理蒸馏版;2026 年热门
Qwen2.5 32BRTX 4090 24Gllama.cppGGUF Q4_K_M4422 GB4K 上下文下勉强装下;想留余量用 Q3
Qwen3 8BRTX 4090 24Gllama.cppGGUF Q4_K_M1425.8 GBQwen3 思考模式;2026 年 8B 旗舰
Qwen3 14BRTX 4090 24GExLlamaV2EXL2 4.65bpw11810 GB推理能力强;16GB 以上的甜点位
Qwen3 32BRTX 4090 24Gllama.cppGGUF Q4_K_M4222.5 GBQwen2.5-32B 的稠密 32B 后继
Qwen3 30B-A3BRTX 4090 24Gllama.cppGGUF Q4_K_M9519 GBMoE 激活 3B —— 16GB 显卡上很快
R1-Distill-Llama-8BRTX 4090 24Gllama.cppGGUF Q4_K_M1455.6 GB8B 体量上的 R1 推理能力
Phi-4 14BRTX 4090 24Gllama.cppGGUF Q4_K_M889.1 GB稠密 14B 表现强;短上下文下 12GB 可跑
Qwen3-Coder 30B-A3BRTX 4090 24Gllama.cppGGUF Q4_K_M9219.2 GB面向 agent 编码的 MoE;原生 256K 上下文
Llama 3.1 8BRTX 3090 24GExLlamaV2EXL2 4.65bpw1755.4 GB较旧但依然可用
Llama 3.1 8BM3 Max 48GOllamaGGUF Q4_K_M685.7 GB统一内存优势
Llama 3.1 8BM2 Ultra 192Gllama.cppGGUF Q4_K_M905.7 GB单卡即可跑 70B

参考模型

Meta Llama 3.1 8B Instruct

PPL 数据集

WikiText-2

上下文

4096 tokens

批大小(Batch Size)

1

框架版本

llamacpp: b4217 (CUDA backend)exllama: ExLlamaV2 0.2.1vllm: v0.6.3ollama: 0.3.14

这些运行时的当前版本(2026-10-06 核对)

llamacpp: b11434vllm: v0.31.0ollama: v0.35.1exllama: v0.3.2 (stalled)

本页的数字是在左列那套软件栈上测得的。这些版本如今已明显落后于当前版本 —— 速度尤其会随运行时变化,因此请把它们当作格式之间的排序参考,而不是你今天会跑出的数值。这个对比说明不了的一件事:ExLlamaV2 自 2025-07 起再没有发布过新版本,维护者的主要精力已经转到另一个仓库 ExLlamaV3(截至上面的日期已到 v1.5.4,更新很勤)。它自己的 README 说得很清楚,这是一个全新的量化格式 EXL3,而不是 EXL2 的版本升级——本索引目前还没有任何模型提供这个格式,所以暂不收录,但本站在跟踪的一个格式陷入停滞,这件事本身值得让读者知道。

速度测试:prompt_len=128,gen_len=128,单序列。PPL 在 WikiText-2 测试集上测量。实际结果因驱动、batch size 和上下文长度可能偏差 ±10%。

吞吐量

提示词长度
128 tokens
生成长度
128 tokens
测量方式(采样次数、取均值还是中位数、是否预热)
未记录
记录口径
生成阶段的 tok/s,不含提示词处理

困惑度

FP16 基准困惑度
6.14
记录口径
相对基准保留的百分比

显存

测量工具
未记录
记录口径
生成过程中的峰值占用,含运行时开销

测试硬件

NVIDIA 显卡:NVIDIA 550.x / CUDA 12.4。Apple 显卡:不涉及 CUDA / 驱动栈——走各框架自己的 Metal 后端。

每台机器的 CPU / 系统内存 / 操作系统
未记录
记录的测试时间范围
未记录
最近一次重新测试
未记录

数据来源: RTX 4090 / 3090 / M3 Max / M2 Ultra 本地实测;llama.cpp b4000+、ExLlamaV2 0.2.x、vLLM 0.6.x、Ollama 0.3.x