开源 · 端侧部署 · 极客优先
2026-10-06最近更新

这张显卡,
到底能跑多大模型?

极致量化。

选一张显卡,选一个用途。这里给出真正装得下的模型、每个模型的显存算法,以及可直接运行的命令。

新手先看 8G 显卡入门指南
GGUFAWQEXL2GPTQ等

你的显卡装得下什么

按 4K 上下文、batch 1 计算 —— 权重 + KV 缓存 + 10% 激活值,数据直接来自模型索引。

示例这里以 RTX 4060 Ti 16G 作为示例 —— 在上方选择你自己的硬件即可看到你的结果。

查看 RTX 4060 Ti 16G 能跑的全部模型 →
90已收录量化模型
4支持格式
76GPU 数据库
97.1%Q4_K_M 质量保留率79 个模型的中位数 · 损失区间 1.4–5.2%

数据更新于 2026-10-06

最近收录

索引里最新加入的模型和硬件 · 数据更新于2026-10-06

完整更新日志 →

常见的入口

从这里开始

实测数据,不是估算

基准测试表的节选。每一行都是真机跑出来的结果,并记录了对应的软件栈。

模型硬件软件栈tok/s显存
Llama 3.1 8BRTX 4090 24GExLlamaV2 · EXL2 4.65bpw2355.4 GB
Qwen3 30B-A3BRTX 4090 24Gllama.cpp · GGUF Q4_K_M9519 GB
Llama 3.1 8BM3 Max 48GOllama · GGUF Q4_K_M685.7 GB
Llama 3.1 8BRTX 3090 24GExLlamaV2 · EXL2 4.65bpw1755.4 GB

测试条件:Meta Llama 3.1 8B Instruct · WikiText-2 · 4096 上下文 · batch 1

RTX 4090 / 3090 / M3 Max / M2 Ultra 本地实测;llama.cpp b4000+、ExLlamaV2 0.2.x、vLLM 0.6.x、Ollama 0.3.x

完整基准表与测试方法 →

编辑推荐

精选优质量化版本 — 点击查看模型详情

查看全部 →

在下载那个 20GB 文件之前

全部 27 个问题

跑一个 7B 模型需要多少显存?

在 Q4_K_M、4K 上下文下约 5.1 GB —— 权重 4.2 GB、KV 缓存 0.5 GB、激活缓冲 0.5 GB,以 WizardLM-2 7B(7B)实算。本索引中每一张 8 GB 显卡都能从容跑下,还有余量。这个数字随上下文增长,而不是随你用得多不多:同一个文件在 32K 下约需 9.0 GB,因为 KV 缓存涨到了 4.0 GB。

16G 显卡能跑 24B 的模型吗?

在 4-bit、短上下文下可以 —— Mistral Small 24B Instruct 在 AWQ INT4 下约需 16 GB 中的 13.2 GB,还剩 2.8 GB。档位比参数量更关键:同一个模型在 Q4_K_M 下是 15.9 GB,占这张卡的 99% —— 在显卡完全空闲时能加载,但没有余量留给更长的窗口。16 GB 显卡能从容运行本索引 90 个模型中的 56 个。

Q4 量化掉点严重吗?

在 Q4_K_M 下,本站有公开困惑度数据的 79 个模型,损失中位数为 2.9% —— 即保留 97.1% —— 区间从 1.4% 到 5.2%。有两点比中位数更重要:同一档位下,小模型掉得比大模型多;而且困惑度衡量的是语言建模能力,不等于「它还能不能做好你的任务」。没有公开数据的模型在本站显示为短横线,而不是当作零损失。

GGUF 和 AWQ 有什么区别,该用哪个?

除非你是在跑服务端,否则选 GGUF。GGUF 什么硬件都能跑 —— CPU、NVIDIA、AMD、Apple —— 本站 90 个模型中有 90 个提供它,而 AWQ 是 53 个。AWQ 的价值在于用 vLLM 做批量请求时的吞吐,适用于 NVIDIA 显卡或 vLLM ROCm 版本支持的 Radeon 显卡;如果只是你一个人和一个模型对话,它给不了 GGUF 给不了的东西。本站有 53 个模型同时提供两种格式,那也是唯一能在同一份权重上比较它们的集合。

发现数字不对?

本索引由人工维护,并对照公开模型卡核对。标注为「估算」的数字是按架构计算得出、并非实测;如果与你自己机器上的结果对不上,欢迎指出,我们会更正。

数据更新日志

最后更新 2026-10-06

展开全部 137 条

2026-10-06基准测试页上的当前运行时版本更新为 vLLM v0.31.0 和 llama.cpp b11434,均取自各项目自己的发布页;Ollama(v0.35.1)和 ExLlamaV3(v1.5.4)未变。llama.cpp 还发布了 v0.6.0,这是本站记录中它的第一个带版本号的正式发布。网站上的模型和显存数字均不受影响。

所有数据均经人工整理并对照社区来源验证。部署前请务必交叉核对 Hugging Face 官方模型卡。