⚖️ 模型对比

模型 A vs B 对比

并排比较显存、速度、质量和 GPU 适配度,选出最适合你硬件的模型。

在上方选择两个模型开始对比

各列的含义

每一行都标注了数字的来源。预估行由计算器所用的同一个函数、按你设定的上下文重新计算 —— 如果两个模型的 KV 缓存形状不同,随着上下文增长它们的排序可能对调。已发布行是发布方给出的固定数字,不随控件变化。规格行是模型自身属性。速度是 RTX 4090、batch=1 下的每秒 token 数。质量损失是相对未量化权重的困惑度上升,越低越好,且绝对值只在同一模型内部可比。

跨家族比较比看上去更难

困惑度是在固定语料上测的,而在不同数据上训练的模型基线本就不同 —— 一个模型损失 2% 和另一个模型损失 2%,代表的退化程度并不相同。这个数字适合用来在同一模型内部挑选量化档位;在模型之间做选择,请结合模型索引和你自己的评测。

常见问题

为什么有时更小的模型反而更占显存?
是 KV 缓存。层数更多或 KV 头更多的模型,每个 token 的缓存开销更大;在长上下文下这可以盖过参数量的差距。把上下文滑块拉低,你会看到排序发生变化。
不同框架之间的速度数字可比吗?
大致可比,且仅限 batch=1。基准页面列出了具体的框架版本与测试参数;一旦开始批量处理请求,吞吐排名会明显变化 —— 那正是 vLLM 拉开差距的场景。
可以分享对比结果吗?
可以 —— 两个模型和上下文长度都保存在 URL 里,直接复制地址栏就能分享你当前看到的内容,并保持你所使用的语言。