并排比较显存、速度、质量和 GPU 适配度,选出最适合你硬件的模型。
在上方选择两个模型开始对比
每一行都标注了数字的来源。预估行由计算器所用的同一个函数、按你设定的上下文重新计算 —— 如果两个模型的 KV 缓存形状不同,随着上下文增长它们的排序可能对调。已发布行是发布方给出的固定数字,不随控件变化。规格行是模型自身属性。速度是 RTX 4090、batch=1 下的每秒 token 数。质量损失是相对未量化权重的困惑度上升,越低越好,且绝对值只在同一模型内部可比。
困惑度是在固定语料上测的,而在不同数据上训练的模型基线本就不同 —— 一个模型损失 2% 和另一个模型损失 2%,代表的退化程度并不相同。这个数字适合用来在同一模型内部挑选量化档位;在模型之间做选择,请结合模型索引和你自己的评测。