这张显卡,
到底能跑多大模型?
极致量化。
选一张显卡,选一个用途。这里给出真正装得下的模型、每个模型的显存算法,以及可直接运行的命令。
新手先看 8G 显卡入门指南你的显卡装得下什么
按 4K 上下文、batch 1 计算 —— 权重 + KV 缓存 + 10% 激活值,数据直接来自模型索引。
示例这里以 RTX 4060 Ti 16G 作为示例 —— 在上方选择你自己的硬件即可看到你的结果。
- 装得下的最强模型Mistral Small 24B Instruct
AWQ · INT4
- 13 GB / 共 16 GB
- 剩余 2.8 GB
- 质量损失 3.8%
- 78 tok/s(RTX 4090)估算
在 4K 上下文下,这张卡还能宽裕运行的最大模型。
- 留有余量Falcon 3 10B Instruct
GGUF · Q4_K_M
- 7.3 GB / 共 16 GB
- 剩余 8.7 GB
- 质量损失 3.1%
- 118 tok/s(RTX 4090)估算
占用不到显存 60% 的最大模型,之后还能把上下文加长很多。
- 速度最快Qwen2.5 0.5B Instruct
GGUF · Q8_0
- 0.6 GB / 共 16 GB
- 剩余 15 GB
- 质量损失 0.5%
- 540 tok/s(RTX 4090)估算
装得下的模型里实测吞吐最高的一个,通常是小模型。该数字在 RTX 4090 上测得,只能当作排序参考,不是你机器上的数值。
数据更新于 2026-10-06
- 新DGX Spark 128G · DGX Spark 64G硬件 · 2026-10-05 收录
- 新OLMo 3 7B Instruct2026-10-05 收录
- 新Arc B580 12G · Arc B570 10G · Arc A770 16G · Arc A750 8G硬件 · 2026-10-03 收录
- 新SmolLM3 3B2026-10-03 收录
- 新ERNIE 4.5 21B-A3B2026-10-03 收录
- 新RTX 5050 · RTX 3060 12G硬件 · 8 / 12 GB · 2026-10-02 收录
常见的入口
从这里开始
实测数据,不是估算
基准测试表的节选。每一行都是真机跑出来的结果,并记录了对应的软件栈。
| 模型 | 硬件 | 软件栈 | tok/s | 显存 |
|---|---|---|---|---|
| Llama 3.1 8B | RTX 4090 24G | ExLlamaV2 · EXL2 4.65bpw | 235 | 5.4 GB |
| Qwen3 30B-A3B | RTX 4090 24G | llama.cpp · GGUF Q4_K_M | 95 | 19 GB |
| Llama 3.1 8B | M3 Max 48G | Ollama · GGUF Q4_K_M | 68 | 5.7 GB |
| Llama 3.1 8B | RTX 3090 24G | ExLlamaV2 · EXL2 4.65bpw | 175 | 5.4 GB |
测试条件:Meta Llama 3.1 8B Instruct · WikiText-2 · 4096 上下文 · batch 1
RTX 4090 / 3090 / M3 Max / M2 Ultra 本地实测;llama.cpp b4000+、ExLlamaV2 0.2.x、vLLM 0.6.x、Ollama 0.3.x
完整基准表与测试方法 →编辑推荐
精选优质量化版本 — 点击查看模型详情
- 新发布OLMo 3 7B InstructGGUFQ4_K_M · 4K 上下文约 6.8 GB · 完全开源,64K 上下文allenaiRTX 4060(8 GB)起可从容运行
- 新发布ERNIE 4.5 21B-A3BGGUFQ4_K_M · 4K 上下文约 14.1 GB · 激活 3B,128K 上下文baiduRTX 4060 Ti 16G(16 GB)起可从容运行
- 新发布SmolLM3 3BGGUFQ4_K_M · 4K 上下文约 2.3 GB · 训练数据公开HuggingFaceTBMac M1 8G(8 GB)起可从容运行
- 新发布Gemma 4 E4B ITGGUFQ4_K_M · 4K 上下文约 4.9 GB · 8 GB 跑图像 + 音频googleMac M1 8G(8 GB)起可从容运行
- 新发布Gemma 4 26B-A4B ITGGUFQ4_K_M · 4K 上下文约 16.4 GB · 激活 4B,256K 上下文googleRadeon RX 7900 XT(20 GB)起可从容运行
- 新发布Gemma 4 31B ITGGUFQ4_K_M · 4K 上下文约 21.1 GB · 60 层中仅 10 层缓存googleRTX 3090(24 GB)起可从容运行
- 新发布GLM-4.7-FlashGGUFQ4_K_M · 4K 上下文约 19.2 GB · 激活 3B,MLA 压缩缓存zai-orgRTX 3090(24 GB)起可从容运行
- 新发布Kimi Linear 48B-A3B InstructGGUFQ4_K_M · 4K 上下文约 30.4 GB · 100 万上下文,27 层中仅 7 层缓存moonshotaiA100 40G(40 GB)起可从容运行
- 新发布Qwen3.8 27BGGUFQ4_K_M · 4K 上下文约 17.5 GB · 64 层中仅 16 层缓存 KVunslothRadeon RX 7900 XT(20 GB)起可从容运行
- 新发布Ministral 3 8B InstructGGUFQ4_K_M · 4K 上下文约 6.0 GB · Mistral 官方 GGUFmistralaiRTX 4060(8 GB)起可从容运行
- 新发布Qwen3-VL 8B InstructGGUFQ4_K_M · 4K 上下文约 6.2 GB · 8B 视觉语言模型bartowskiRTX 4060(8 GB)起可从容运行
- 热门GPT-OSS 20BGGUFMXFP4 · 4K 上下文约 12.8 GB · 原生 4-bitopenaiRTX 4060 Ti 16G(16 GB)起可从容运行
- 热门Qwen3-Coder 30B-A3B InstructGGUFQ4_K_M · 4K 上下文约 19.7 GB · agent 编码模型bartowskiRTX 3090(24 GB)起可从容运行
在下载那个 20GB 文件之前
全部 27 个问题跑一个 7B 模型需要多少显存?
在 Q4_K_M、4K 上下文下约 5.1 GB —— 权重 4.2 GB、KV 缓存 0.5 GB、激活缓冲 0.5 GB,以 WizardLM-2 7B(7B)实算。本索引中每一张 8 GB 显卡都能从容跑下,还有余量。这个数字随上下文增长,而不是随你用得多不多:同一个文件在 32K 下约需 9.0 GB,因为 KV 缓存涨到了 4.0 GB。
16G 显卡能跑 24B 的模型吗?
在 4-bit、短上下文下可以 —— Mistral Small 24B Instruct 在 AWQ INT4 下约需 16 GB 中的 13.2 GB,还剩 2.8 GB。档位比参数量更关键:同一个模型在 Q4_K_M 下是 15.9 GB,占这张卡的 99% —— 在显卡完全空闲时能加载,但没有余量留给更长的窗口。16 GB 显卡能从容运行本索引 90 个模型中的 56 个。
Q4 量化掉点严重吗?
在 Q4_K_M 下,本站有公开困惑度数据的 79 个模型,损失中位数为 2.9% —— 即保留 97.1% —— 区间从 1.4% 到 5.2%。有两点比中位数更重要:同一档位下,小模型掉得比大模型多;而且困惑度衡量的是语言建模能力,不等于「它还能不能做好你的任务」。没有公开数据的模型在本站显示为短横线,而不是当作零损失。
GGUF 和 AWQ 有什么区别,该用哪个?
除非你是在跑服务端,否则选 GGUF。GGUF 什么硬件都能跑 —— CPU、NVIDIA、AMD、Apple —— 本站 90 个模型中有 90 个提供它,而 AWQ 是 53 个。AWQ 的价值在于用 vLLM 做批量请求时的吞吐,适用于 NVIDIA 显卡或 vLLM ROCm 版本支持的 Radeon 显卡;如果只是你一个人和一个模型对话,它给不了 GGUF 给不了的东西。本站有 53 个模型同时提供两种格式,那也是唯一能在同一份权重上比较它们的集合。
发现数字不对?
本索引由人工维护,并对照公开模型卡核对。标注为「估算」的数字是按架构计算得出、并非实测;如果与你自己机器上的结果对不上,欢迎指出,我们会更正。
数据更新日志
最后更新 2026-10-06
2026-10-06基准测试页上的当前运行时版本更新为 vLLM v0.31.0 和 llama.cpp b11434,均取自各项目自己的发布页;Ollama(v0.35.1)和 ExLlamaV3(v1.5.4)未变。llama.cpp 还发布了 v0.6.0,这是本站记录中它的第一个带版本号的正式发布。网站上的模型和显存数字均不受影响。
所有数据均经人工整理并对照社区来源验证。部署前请务必交叉核对 Hugging Face 官方模型卡。