量化模型库
开源量化模型结构化索引 — 不托管文件,只提供精准元数据 · 索引共 90 个模型
数据更新于 2026-10-06
按 GPU 一键筛选(4K 上下文) · 含临界可用
参数量
用途分类
目标硬件
量化格式
时效
70 / 90 个模型
正在显示全部 70 个模型
Llama 3.1 8B Instruct
8BMeta Llama 3.1
Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。
Q4_K_M · RTX 4090 · batch 1
5.7 GB
显存
128K
上下文
148
tok/s
可用格式
Llama 3.1 70B Instruct
70BMeta Llama 3.1
Meta 前沿 70B 模型,需要 40GB+ 显存,适合双 3090 或 M2 Ultra。
Q4_K_M · RTX 4090 · batch 1
43.5 GB
显存
128K
上下文
—
tok/s
可用格式
Llama 3.2 3B Instruct
3BMeta Llama 3.2
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
Q4_K_M · RTX 4090 · batch 1
2.2 GB
显存
128K
上下文
320
tok/s估算
可用格式
Qwen2.5 7B Instruct
7BAlibaba Qwen2.5
阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。
Q4_K_M · RTX 4090 · batch 1
5.4 GB
显存
128K
上下文
155
tok/s
可用格式
Qwen2.5 14B Instruct
14BAlibaba Qwen2.5
性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。
Q4_K_M · RTX 4090 · batch 1
10.2 GB
显存
128K
上下文
98
tok/s估算
可用格式
Qwen2.5 32B Instruct
32BAlibaba Qwen2.5
24GB 显存单卡可运行 Q4_K_S,推理能力接近 GPT-4,性价比极高。
Q4_K_M · RTX 4090 · batch 1
22.0 GB
显存
128K
上下文
44
tok/s
可用格式
DeepSeek-Coder-V2-Lite Instruct
16B-A2.4BDeepSeek
MoE 架构代码模型,激活参数约 2.4B,代码能力卓越。注意力采用 MLA:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b 张量)在 32K 下约缓存 1 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 8.4 GB。
Q4_K_M · RTX 4090 · batch 1
11.1 GB
显存
160K
上下文
145
tok/s估算
可用格式
Phi-3.5 Mini Instruct
3.8BMicrosoft Phi
Microsoft 的小巧精悍之作,端侧部署最佳 4B 模型之一。
Q4_K_M · RTX 4090 · batch 1
2.8 GB
显存
128K
上下文
298
tok/s估算
可用格式
Mistral Nemo 12B Instruct
12BMistral AI
Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。
Q4_K_M · RTX 4090 · batch 1
8.5 GB
显存
128K
上下文
112
tok/s估算
可用格式
Qwen2.5 72B Instruct
72BAlibaba Qwen2.5
Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。
Q4_K_M · RTX 4090 · batch 1
43.6 GB
显存
128K
上下文
—
tok/s
可用格式
DeepSeek-R1-Distill-Qwen-14B
14BDeepSeek
R1 推理能力蒸馏至 14B,社区热度极高,思维链能力出色。
Q4_K_M · RTX 4090 · batch 1
10.2 GB
显存
128K
上下文
95
tok/s
可用格式
Llama 3.3 70B Instruct
70BMeta Llama 3.3
Meta 最新 70B,多语言能力提升,可无缝替换 Llama 3.1 70B。
Q4_K_M · RTX 4090 · batch 1
43.5 GB
显存
128K
上下文
—
tok/s
可用格式
Mistral Small 24B Instruct
24BMistral AI
Mistral 高效 24B 模型,多语言能力强,Q4 量化可装入 24GB 显存。
Q4_K_M · RTX 4090 · batch 1
14.2 GB
显存
32K
上下文
62
tok/s估算
可用格式
Qwen2.5-Coder 32B Instruct
32BAlibaba Qwen2.5
顶级开源代码模型,HumanEval 在 32B 规模可与 GPT-4o 竞争。
Q4_K_M · RTX 4090 · batch 1
22.0 GB
显存
128K
上下文
44
tok/s估算
可用格式
Qwen2.5-Coder 7B Instruct
7BAlibaba Qwen2.5
最佳 7B 代码模型,适合 8–16GB 显存的本地开发助手。
Q4_K_M · RTX 4090 · batch 1
5.4 GB
显存
128K
上下文
158
tok/s估算
可用格式
Qwen2.5 3B Instruct
3BAlibaba Qwen2.5
Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。
Q4_K_M · RTX 4090 · batch 1
2.1 GB
显存
32K
上下文
340
tok/s估算
可用格式
Llama 3.2 1B Instruct
1BMeta Llama 3.2
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
Q4_K_M · RTX 4090 · batch 1
1.0 GB
显存
128K
上下文
520
tok/s估算
可用格式
DeepSeek-R1-Distill-Llama-70B
70BDeepSeek
R1 推理能力注入 Llama 70B 架构,双卡部署的顶级开源推理模型。
Q4_K_M · RTX 4090 · batch 1
43.5 GB
显存
128K
上下文
—
tok/s
可用格式
Codestral 22B
22BMistral AI
Mistral 专用代码模型,支持 80+ 编程语言,支持 Fill-in-the-Middle。
Q4_K_M · RTX 4090 · batch 1
14.8 GB
显存
32K
上下文
58
tok/s估算
可用格式
Llama 3.2 11B Vision Instruct
11BMeta Llama 3.2
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
Q4_K_M · RTX 4090 · batch 1
9.5 GB
显存
128K
上下文
88
tok/s估算
可用格式
Nous Hermes 3 Llama 3.1 8B
8BNousResearch
基于 Llama 3.1 8B 微调,角色扮演和指令遵循能力增强。
Q4_K_M · RTX 4090 · batch 1
5.7 GB
显存
128K
上下文
148
tok/s估算
可用格式
Granite 3.1 8B Instruct
8BIBM Granite
IBM 企业级 8B 模型,RAG 和工具调用能力强,Apache 2.0 许可。
Q4_K_M · RTX 4090 · batch 1
5.8 GB
显存
128K
上下文
142
tok/s估算
可用格式
Qwen2.5 0.5B Instruct
0.5BAlibaba Qwen2.5
最小 Qwen2.5,适合树莓派、手机端和超低延迟演示。
Q4_K_M · RTX 4090 · batch 1
0.6 GB
显存
32K
上下文
620
tok/s估算
可用格式
Qwen2.5 1.5B Instruct
1.5BAlibaba Qwen2.5
支持 128K 上下文的微型 Qwen,摘要和对话能力出人意料。
Q4_K_M · RTX 4090 · batch 1
1.4 GB
显存
128K
上下文
480
tok/s估算
可用格式
Phi-3 Medium 14B Instruct
14BMicrosoft Phi
Microsoft 中型 Phi-3,16GB 显卡上质量/显存比极佳。
Q4_K_M · RTX 4090 · batch 1
9.8 GB
显存
128K
上下文
102
tok/s估算
可用格式
Phi-4 Mini Instruct
3.8BMicrosoft Phi
最新 Phi mini,数学和代码能力提升,4B 级性能强者。
Q4_K_M · RTX 4090 · batch 1
2.8 GB
显存
128K
上下文
305
tok/s估算
可用格式
DeepSeek-V2-Lite Chat
16B-A2.4BDeepSeek
MoE 通用模型(激活约 2.4B),长上下文,多语言对话能力强。注意力采用 MLA:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b 张量)在 32K 下约缓存 1 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 8.4 GB。
Q4_K_M · RTX 4090 · batch 1
11.0 GB
显存
160K
上下文
142
tok/s估算
可用格式
DeepSeek-R1-Distill-Qwen-7B
7BDeepSeek
7B 体量的 R1 推理能力,8–12GB 显存思维链实验性价比最高。
Q4_K_M · RTX 4090 · batch 1
5.4 GB
显存
128K
上下文
152
tok/s估算
可用格式
DeepSeek-R1-Distill-Qwen-32B
32BDeepSeek
R1 蒸馏至 32B,单卡 24GB(Q3/Q4)即可接近前沿推理能力。
Q4_K_M · RTX 4090 · batch 1
22.2 GB
显存
128K
上下文
42
tok/s估算
可用格式
Llama 3.2 90B Vision Instruct
90BMeta Llama 3.2
旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。
Q4_K_M · RTX 4090 · batch 1
54.8 GB
显存
128K
上下文
—
tok/s
可用格式
Falcon 3 10B Instruct
10BTII UAE
TII 最新 Falcon,多语言与代码能力均衡。
Q4_K_M · RTX 4090 · batch 1
7.0 GB
显存
32K
上下文
118
tok/s估算
可用格式
Qwen3 8B Instruct
8BAlibaba Qwen3
最新 Qwen3 稠密 8B,支持思考模式,本地部署比 Qwen2.5 7B 全面升级。
Q4_K_M · RTX 4090 · batch 1
5.8 GB
显存
40K
上下文
142
tok/s
可用格式
Qwen3 14B Instruct
14BAlibaba Qwen3
Qwen3 14B — 2026 Qwen 系列中推理能力与显存占用的最佳平衡点。
Q4_K_M · RTX 4090 · batch 1
10.5 GB
显存
40K
上下文
88
tok/s
可用格式
Gemma 3 4B IT
4BGoogle Gemma 3
Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。
Q4_K_M · RTX 4090 · batch 1
3.4 GB
显存
128K
上下文
175
tok/s估算
可用格式
Gemma 3 12B IT
12BGoogle Gemma 3
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
Q4_K_M · RTX 4090 · batch 1
8.8 GB
显存
128K
上下文
105
tok/s估算
可用格式
Llama 4 Scout 17B (16E)
109B MoEMeta Llama 4
Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。
Q4_K_M · RTX 4090 · batch 1
68.0 GB
显存
10M
上下文
—
tok/s
可用格式
Llama 4 Maverick 17B (128E)
400B MoEMeta Llama 4
Llama 4 Maverick 旗舰 MoE(激活 17B / 总 400B),需多卡或 H100 集群。
Q4_K_M · RTX 4090 · batch 1
245.0 GB
显存
1M
上下文
—
tok/s
可用格式
Llama 3.1 405B Instruct
405BMeta Llama 3.1
Meta 前沿稠密 405B,Q4 约需 230GB+ 显存;双 H100 80G 或 8 卡消费级方案。
Q4_K_M · RTX 4090 · batch 1
238.0 GB
显存
128K
上下文
—
tok/s
可用格式
Qwen3 32B Instruct
32BAlibaba Qwen3
Qwen3 稠密 32B — Qwen2.5-32B 继任者,推理与思考模式全面升级。
Q4_K_M · RTX 4090 · batch 1
22.5 GB
显存
40K
上下文
42
tok/s
可用格式
Qwen3 30B-A3B Instruct
30B-A3BAlibaba Qwen3
Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。
Q4_K_M · RTX 4090 · batch 1
19.0 GB
显存
40K
上下文
95
tok/s
可用格式
Qwen3 235B-A22B Instruct
235B-A22BAlibaba Qwen3
Qwen3 旗舰 MoE(激活 22B / 总 235B)。Q4_K_M 约 142GB,对标 DeepSeek-R1 级模型。
Q4_K_M · RTX 4090 · batch 1
142.0 GB
显存
40K
上下文
—
tok/s
可用格式
DeepSeek-V3
671B MoEDeepSeek
DeepSeek-V3 前沿 MoE(激活约 37B / 总 671B)。MLA + FP8;Q4 需多节点 GPU 集群。MLA 缓存:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b)在 32K 下约 2 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 150 GB。
Q4_K_M · RTX 4090 · batch 1
385.0 GB
显存
160K
上下文
—
tok/s
可用格式
DeepSeek-R1
671B MoEDeepSeek
基于 V3 MoE 的 DeepSeek-R1 推理模型。前沿级思维链 — 本地 GPU 请用蒸馏版。MLA 缓存:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b)在 32K 下约 2 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 150 GB。
Q4_K_M · RTX 4090 · batch 1
385.0 GB
显存
160K
上下文
—
tok/s
可用格式
Qwen3 4B Instruct
4BAlibaba Qwen3
最小 Qwen3 稠密模型,支持思考模式。Q4 约 3.2GB,适合 8GB 显卡与边缘设备。
Q4_K_M · RTX 4090 · batch 1
3.2 GB
显存
32K
上下文
168
tok/s
可用格式
Qwen3-Coder 30B-A3B Instruct
30B-A3BAlibaba Qwen3
Agentic 代码 MoE,3.3B 激活参数,原生 256K 上下文。16–24GB 显卡上最强开源代码模型之一。
Q4_K_M · RTX 4090 · batch 1
19.2 GB
显存
256K
上下文
92
tok/s
可用格式
Mistral Large 3 675B Instruct
675B MoEMistral AI
Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。注意力为 DeepSeek 式 MLA,实际 KV 缓存比下方按常规结构(未核实)估算的数字小。32K 下相对约 390 GB 权重可忽略;用满 256K 时,请把缓存数字当作上限。
Q4_K_M · RTX 4090 · batch 1
388.0 GB
显存
256K
上下文
—
tok/s
可用格式
GLM-4-9B-Chat
9BZhipu GLM-4
智谱 GLM-4 开源 9B,128K 上下文,支持工具调用,中英双语表现突出。
Q4_K_M · RTX 4090 · batch 1
6.2 GB
显存
128K
上下文
135
tok/s估算
可用格式
Gemma 3 27B IT
27BGoogle Gemma 3
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
Q4_K_M · RTX 4090 · batch 1
16.2 GB
显存
128K
上下文
48
tok/s社区
可用格式
DeepSeek-R1-Distill-Llama-8B
8BDeepSeek
R1 推理蒸馏到 Llama 3.1 8B。8–12GB 显卡上最佳思维链之一,社区 GGUF 极丰富。
Q4_K_M · RTX 4090 · batch 1
5.6 GB
显存
128K
上下文
145
tok/s社区
可用格式
Phi-4 14B
14BMicrosoft Phi
微软 Phi-4 稠密 14B,同尺寸推理能力突出。Q4 约 9GB,12GB 卡中等上下文可跑。
Q4_K_M · RTX 4090 · batch 1
9.1 GB
显存
16K
上下文
88
tok/s社区
可用格式
Qwen3 1.7B Instruct
1.7BAlibaba Qwen3
迷你 Qwen3,支持思考模式。Q4 约 1.4GB,适合手机旁路、NUC 与常驻本地 Agent。
Q4_K_M · RTX 4090 · batch 1
1.4 GB
显存
32K
上下文
280
tok/s社区
可用格式
GPT-OSS 20B
21B MoEOpenAI GPT-OSS
OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。
MXFP4 · RTX 4090 · batch 1
12.8 GB
显存
128K
上下文
195
tok/s社区
可用格式
GPT-OSS 120B
117B MoEOpenAI GPT-OSS
GPT-OSS 大杯(总 117B / 激活 5.1B)。原生 MXFP4 权重约 61GB —— 单张 80GB 卡或 128GB 统一内存 Mac 可跑。24GB 消费卡部分卸载虽慢但可用。
MXFP4 · RTX 4090 · batch 1
61.0 GB
显存
128K
上下文
—
tok/s
可用格式
GLM-4.5-Air
106B MoEZhipu GLM-4.5
智谱 Agent/推理向 MoE(总 106B / 激活 12B)。Q4 约 64GB —— 96GB+ 统一内存 Mac 或双 48GB 卡最合适。同级别中工具调用能力突出。
Q4_K_M · RTX 4090 · batch 1
64.3 GB
显存
128K
上下文
—
tok/s
可用格式
Devstral Small 1.1 24B
24BMistral Devstral
Mistral 与 All Hands 合作的 Agent 编码模型,基于 Mistral Small 3.1。面向仓库级工具调用而非单文件补全。Q4 约 14GB,16GB 显卡可跑。
Q4_K_M · RTX 4090 · batch 1
14.3 GB
显存
128K
上下文
62
tok/s社区
可用格式
Qwen3-VL 8B Instruct
8BAlibaba Qwen3-VL
当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。
Q4_K_M · RTX 4090 · batch 1
5.9 GB
显存
40K
上下文
140
tok/s社区
可用格式
Qwen3-VL 30B-A3B Instruct
30B-A3BAlibaba Qwen3-VL
多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。
Q4_K_M · RTX 4090 · batch 1
19.0 GB
显存
40K
上下文
95
tok/s社区
可用格式
Magistral Small 1.2 24B
24BMistral Magistral
Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。
Q4_K_M · RTX 4090 · batch 1
14.3 GB
显存
128K
上下文
60
tok/s社区
可用格式
Seed-OSS 36B Instruct
36BByteDance Seed
稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。
Q4_K_M · RTX 4090 · batch 1
21.8 GB
显存
512K
上下文
42
tok/s社区
可用格式
Ministral 3 8B Instruct
8BMistral Ministral 3
Mistral 官方直接发布 GGUF,分 3B / 8B / 14B 与 Instruct、Reasoning 两种变体;其中 8B 在 Q4 下能装进 8GB 显卡并留出可用的上下文余量。34 层全部是标准全注意力,因此下方的显存估算与计算器的假设完全一致。各档位的质量损失官方未公布。
Q4_K_M · RTX 4090 · batch 1
5.2 GB
显存
256K
上下文
—
tok/s
可用格式
Qwen3.8 27B
27BAlibaba Qwen3.8
混合注意力:64 层中只有 16 层保留 KV 缓存,所以这个 27B 模型在 262K 上下文下的缓存约 16GB,而不是 64GB。按常规架构计算会把缓存高估四倍 —— 这里的估算只计入那 16 层,并与 8K、32K、262K 三个已公开实测值吻合。各档位的质量损失官方未公布。
Q4_K_M · RTX 4090 · batch 1
15.3 GB
显存
256K
上下文
—
tok/s
可用格式
GLM-4.7-Flash
30B-A3BZhipu GLM-4.7
智谱 GLM-4.7 系列的轻量款:总参数 30B,每 token 激活约 3B,MIT 许可。注意力采用 MLA,每层每个 token 只缓存一个 576 维的压缩向量,而不是完整的 K 和 V——所以 32K 上下文下缓存不到 2 GB,常规 47 层模型需要的是它的好几倍。llama.cpp 按 DeepSeek-2 类模型运行它。下方体积使用计算器通用的 Q4_K_M / Q8_0 比特率:未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
18.2 GB
显存
128K
上下文
—
tok/s
可用格式
Kimi Linear 48B-A3B Instruct
48B-A3BMoonshot Kimi Linear
月之暗面的混合线性注意力模型:总参数 48B,激活 3B,上下文窗口 100 万 token。27 层中只有 7 层保留会增长的缓存,而且存的是 MLA 压缩向量,所以即使用满 100 万 token,缓存也只要约 8 GB——决定它能在什么硬件上跑的是权重,不是上下文。Q4 下,48 GB 及以上的 Mac 可以从容运行;32 GB 显卡只能勉强装下、几乎不剩余量。下方体积使用计算器通用的比特率:未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
29.1 GB
显存
1M
上下文
—
tok/s
可用格式
Gemma 4 26B-A4B IT
26B-A4BGoogle Gemma 4
Google Gemma 4 的混合专家模型:文本部分约 25B 参数,每 token 激活约 4B,256K 上下文,支持图像输入。30 层中只有 5 层的缓存随上下文增长,而且这些层用的是更少、更宽的注意力头,所以缓存很小——32K 下约 0.9 GB,用满 256K 也只要约 5.3 GB。Q4 下 32K 上下文约 17 GB:24 GB 显卡可以从容运行,甚至能加载完整窗口(偏紧)。16 GB 显卡差一点装不下。下方体积使用计算器通用比特率——未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
15.3 GB
显存
256K
上下文
—
tok/s
可用格式
Gemma 4 31B IT
31BGoogle Gemma 4
Google Gemma 4 的稠密旗舰:约 31B 参数,256K 上下文,支持图像输入。60 层中只有 10 层缓存完整上下文,而且这些层只用 4 个宽 KV 头,所以 128K 上下文只增加约 11 GB 缓存,常规的 60 层结构则要约 120 GB。Q4 下 4K 上下文约 21 GB——在 24 GB 显卡上刚好压在"从容"的边缘,32K 起就偏紧;32 GB 显卡跑 32K 很从容。下方体积使用计算器通用比特率——未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
18.6 GB
显存
256K
上下文
—
tok/s
可用格式
Gemma 4 E4B IT
E4BGoogle Gemma 4
Google 面向端侧的 Gemma 4:实际参与计算的约 4.7B 参数,外加一张 2.8B 的逐层嵌入表,128K 上下文,支持图像和音频输入。42 层中只有 4 层的缓存随上下文增长,所以用满 128K 也只要约 2.0 GB 缓存。Q4 下 4K 上下文约 4.9 GB,用满窗口约 7.0 GB——日常上下文长度下 8 GB 显卡可以从容运行。这里的体积按整个模型都放进 GPU 内存计算,也就是 Mac 或整模型上 GPU 时的占用;llama.cpp 会把嵌入表留在系统内存,所以在独立显卡上,Q4 实际显存占用比这里少约 1.6 GB。体积使用计算器通用比特率——未能核对到 GGUF 文件大小。
Q4_K_M · RTX 4090 · batch 1
4.6 GB
显存
128K
上下文
—
tok/s
可用格式
Gemma 4 E2B IT
E2BGoogle Gemma 4
最小的 Gemma 4:实际参与计算的约 2.3B 参数,外加一张 2.3B 的逐层嵌入表,128K 上下文,支持图像和音频输入。它的缓存几乎不增长——35 层中只有 3 层跟踪完整上下文,128K 下约 0.8 GB。Q4 下 4K 上下文约 3.0 GB,用满窗口约 3.8 GB——本索引中任何一张卡、以及 8 GB 的 Mac 都能从容运行。体积按整个模型都放进 GPU 内存计算;llama.cpp 会把嵌入表留在系统内存,所以在独立显卡上,Q4 实际显存占用比这里少约 1.3 GB。体积使用计算器通用比特率——未能核对到 GGUF 文件大小。
Q4_K_M · RTX 4090 · batch 1
2.8 GB
显存
128K
上下文
—
tok/s
可用格式
SmolLM3 3B
3BHugging Face SmolLM
Hugging Face 完全开源的 3B 模型,训练数据和训练方法随权重一起公开。它带一个可开关的推理模式,实际训练到的上下文窗口是 64K,128K 要靠 YaRN 外推。只有 4 个 KV 头,缓存很小,所以长窗口也负担得起:Q4_K_M 下短上下文能放进 4 GB 显卡,用满训练窗口也能放进 8 GB 显卡。这也让它成为本站少数在纯 CPU 机器上也现实可用的模型之一。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
2.3 GB
显存
64K
上下文
—
tok/s
可用格式
ERNIE 4.5 21B-A3B
21B-A3BBaidu ERNIE 4.5
百度开源的混合专家模型:总参数约 21.8B,每个 token 约激活 3B,由 64 个路由专家(每个 token 选 6 个)加 2 个共享专家组成。总参数决定显存,激活参数决定速度,所以它需要 20B 级模型的显存,每个 token 读取的数据量却和 3B 模型差不多。Q4_K_M 在 4K 上下文下约需 14.1 GB,在 16 GB 显卡上正好处于“宽裕”的边缘,到 32K 就偏紧了;24 GB 显卡,或 24 GB 的 Mac(靠 GPU 可用的那部分统一内存)才有真正的上下文余量。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
14.1 GB
显存
128K
上下文
—
tok/s
可用格式
OLMo 3 7B Instruct
7BAllen AI OLMo
Allen AI 完全开源的 7B 模型,训练数据、代码和中间检查点一并公开。上一代只有 4K 上下文,OLMo 3 达到 64K(由 8K 基础通过 YaRN 扩展而来)。每四层中有三层使用 4K 滑动窗口,这正是长上下文负担得起的原因。不过它仍是完整的多头注意力,没有共享 KV 头,所以长上下文的代价比大多数 7B–8B 模型高。Q4_K_M 在 4K 上下文下约需 6.8 GB,32K 下约 10.9 GB;如果没有滑动窗口,32K 需要约 22 GB。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
Q4_K_M · RTX 4090 · batch 1
6.8 GB
显存
64K
上下文
—
tok/s
可用格式