基准测试与洞察
数据说话,拒绝炒作 — 真实硬件实测
下面每一行数据都产自本页描述的那台机器,不是从别处收集来的。这也意味着覆盖面很窄:在 GPU 索引的 76 张卡里,实测覆盖了 4 张,共 16 次运行。本站任何没有实测的数字都会标注为「预估」——而这一页,就是所有实测数字唯一的来源。
同样的数据,以文本呈现
图表由 SVG 路径绘制,其中的数字并不是可读文本。下面两张表提供相同的数据。
哪些有实测,哪些没有
仅有预估
索引里剩下的 76 张卡。它们的数字来自和显存计算器同一套公式,按公开的显存带宽换算得出——不是另一套隐藏的实测数据。
完全没覆盖
- 双 RTX 3090 指南之外的多卡吞吐
- 大于 1 的 batch size
- 与生成速度分开的提示词处理(prefill)速度
- 困惑度以外的任何质量指标
硬件 × 格式矩阵
多模型真实硬件速度与显存 — 可比量化级别横向对照
| 模型 | 硬件 | 框架 | 量化级别 | 速度 (tok/s) | 显存用量 | 备注 |
|---|---|---|---|---|---|---|
| Llama 3.1 8B | RTX 4090 24G | ExLlamaV2 | EXL2 4.65bpw | 235 | 5.4 GB | 消费级最快 |
| Llama 3.1 8B | RTX 4090 24G | vLLM | AWQ INT4 | 218 | 4.9 GB | 批量 API 服务最佳 |
| Llama 3.1 8B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 148 | 5.7 GB | 部署最简单 |
| Qwen2.5 7B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 155 | 5.4 GB | 代码能力强;显存占用接近 8B |
| DeepSeek-R1 14B | RTX 4090 24G | ExLlamaV2 | EXL2 4.65bpw | 128 | 9.8 GB | 推理蒸馏版;2026 年热门 |
| Qwen2.5 32B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 44 | 22 GB | 4K 上下文下勉强装下;想留余量用 Q3 |
| Qwen3 8B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 142 | 5.8 GB | Qwen3 思考模式;2026 年 8B 旗舰 |
| Qwen3 14B | RTX 4090 24G | ExLlamaV2 | EXL2 4.65bpw | 118 | 10 GB | 推理能力强;16GB 以上的甜点位 |
| Qwen3 32B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 42 | 22.5 GB | Qwen2.5-32B 的稠密 32B 后继 |
| Qwen3 30B-A3B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 95 | 19 GB | MoE 激活 3B —— 16GB 显卡上很快 |
| R1-Distill-Llama-8B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 145 | 5.6 GB | 8B 体量上的 R1 推理能力 |
| Phi-4 14B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 88 | 9.1 GB | 稠密 14B 表现强;短上下文下 12GB 可跑 |
| Qwen3-Coder 30B-A3B | RTX 4090 24G | llama.cpp | GGUF Q4_K_M | 92 | 19.2 GB | 面向 agent 编码的 MoE;原生 256K 上下文 |
| Llama 3.1 8B | RTX 3090 24G | ExLlamaV2 | EXL2 4.65bpw | 175 | 5.4 GB | 较旧但依然可用 |
| Llama 3.1 8B | M3 Max 48G | Ollama | GGUF Q4_K_M | 68 | 5.7 GB | 统一内存优势 |
| Llama 3.1 8B | M2 Ultra 192G | llama.cpp | GGUF Q4_K_M | 90 | 5.7 GB | 单卡即可跑 70B |
参考模型
Meta Llama 3.1 8B Instruct
PPL 数据集
WikiText-2
上下文
4096 tokens
批大小(Batch Size)
1
框架版本
这些运行时的当前版本(2026-10-06 核对)
本页的数字是在左列那套软件栈上测得的。这些版本如今已明显落后于当前版本 —— 速度尤其会随运行时变化,因此请把它们当作格式之间的排序参考,而不是你今天会跑出的数值。这个对比说明不了的一件事:ExLlamaV2 自 2025-07 起再没有发布过新版本,维护者的主要精力已经转到另一个仓库 ExLlamaV3(截至上面的日期已到 v1.5.4,更新很勤)。它自己的 README 说得很清楚,这是一个全新的量化格式 EXL3,而不是 EXL2 的版本升级——本索引目前还没有任何模型提供这个格式,所以暂不收录,但本站在跟踪的一个格式陷入停滞,这件事本身值得让读者知道。
速度测试:prompt_len=128,gen_len=128,单序列。PPL 在 WikiText-2 测试集上测量。实际结果因驱动、batch size 和上下文长度可能偏差 ±10%。
吞吐量
- 提示词长度
- 128 tokens
- 生成长度
- 128 tokens
- 测量方式(采样次数、取均值还是中位数、是否预热)
- 未记录
- 记录口径
- 生成阶段的 tok/s,不含提示词处理
困惑度
- FP16 基准困惑度
- 6.14
- 记录口径
- 相对基准保留的百分比
显存
- 测量工具
- 未记录
- 记录口径
- 生成过程中的峰值占用,含运行时开销
测试硬件
NVIDIA 显卡:NVIDIA 550.x / CUDA 12.4。Apple 显卡:不涉及 CUDA / 驱动栈——走各框架自己的 Metal 后端。
数据来源: RTX 4090 / 3090 / M3 Max / M2 Ultra 本地实测;llama.cpp b4000+、ExLlamaV2 0.2.x、vLLM 0.6.x、Ollama 0.3.x