量化模型库

开源量化模型结构化索引 — 不托管文件,只提供精准元数据 · 索引共 90 个模型

数据更新于 2026-10-06

90 个模型42 个系列4 种量化格式≤3B · 117B · 2314B · 1632B · 2470B+ · 16

按 GPU 一键筛选(4K 上下文) · 含临界可用

参数量

用途分类

目标硬件

量化格式

时效

70 / 90 个模型

正在显示全部 70 个模型

Llama 3.1 8B Instruct

8B

Meta Llama 3.1

Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。

Q4_K_M · RTX 4090 · batch 1

5.7 GB

显存

128K

上下文

148

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Llama 3.1 70B Instruct

70B

Meta Llama 3.1

Meta 前沿 70B 模型,需要 40GB+ 显存,适合双 3090 或 M2 Ultra。

Q4_K_M · RTX 4090 · batch 1

43.5 GB

显存

128K

上下文

—

tok/s

可用格式

GGUFAWQEXL2
专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Llama 3.2 3B Instruct

3B

Meta Llama 3.2

小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。

Q4_K_M · RTX 4090 · batch 1

2.2 GB

显存

128K

上下文

320

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen2.5 7B Instruct

7B

Alibaba Qwen2.5

阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。

Q4_K_M · RTX 4090 · batch 1

5.4 GB

显存

128K

上下文

155

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen2.5 14B Instruct

14B

Alibaba Qwen2.5

性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。

Q4_K_M · RTX 4090 · batch 1

10.2 GB

显存

128K

上下文

98

tok/s估算

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Qwen2.5 32B Instruct

32B

Alibaba Qwen2.5

24GB 显存单卡可运行 Q4_K_S,推理能力接近 GPT-4,性价比极高。

Q4_K_M · RTX 4090 · batch 1

22.0 GB

显存

128K

上下文

44

tok/s

可用格式

GGUFEXL2
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-Coder-V2-Lite Instruct

16B-A2.4B

DeepSeek

MoE 架构代码模型,激活参数约 2.4B,代码能力卓越。注意力采用 MLA:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b 张量)在 32K 下约缓存 1 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 8.4 GB。

Q4_K_M · RTX 4090 · batch 1

11.1 GB

显存

160K

上下文

145

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Phi-3.5 Mini Instruct

3.8B

Microsoft Phi

Microsoft 的小巧精悍之作,端侧部署最佳 4B 模型之一。

Q4_K_M · RTX 4090 · batch 1

2.8 GB

显存

128K

上下文

298

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Mistral Nemo 12B Instruct

12B

Mistral AI

Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。

Q4_K_M · RTX 4090 · batch 1

8.5 GB

显存

128K

上下文

112

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Qwen2.5 72B Instruct

72B

Alibaba Qwen2.5

Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。

Q4_K_M · RTX 4090 · batch 1

43.6 GB

显存

128K

上下文

—

tok/s

可用格式

GGUFAWQEXL2
专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Qwen-14B

14B

DeepSeek

R1 推理能力蒸馏至 14B,社区热度极高,思维链能力出色。

Q4_K_M · RTX 4090 · batch 1

10.2 GB

显存

128K

上下文

95

tok/s

可用格式

GGUFEXL2AWQ
消费级显卡
GGUF Q4_K_M
Hugging Face

Llama 3.3 70B Instruct

70B

Meta Llama 3.3

Meta 最新 70B,多语言能力提升,可无缝替换 Llama 3.1 70B。

Q4_K_M · RTX 4090 · batch 1

43.5 GB

显存

128K

上下文

—

tok/s

可用格式

GGUFAWQ
专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Mistral Small 24B Instruct

24B

Mistral AI

Mistral 高效 24B 模型,多语言能力强,Q4 量化可装入 24GB 显存。

Q4_K_M · RTX 4090 · batch 1

14.2 GB

显存

32K

上下文

62

tok/s估算

可用格式

GGUFAWQEXL2
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen2.5-Coder 32B Instruct

32B

Alibaba Qwen2.5

顶级开源代码模型,HumanEval 在 32B 规模可与 GPT-4o 竞争。

Q4_K_M · RTX 4090 · batch 1

22.0 GB

显存

128K

上下文

44

tok/s估算

可用格式

GGUFEXL2AWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen2.5-Coder 7B Instruct

7B

Alibaba Qwen2.5

最佳 7B 代码模型,适合 8–16GB 显存的本地开发助手。

Q4_K_M · RTX 4090 · batch 1

5.4 GB

显存

128K

上下文

158

tok/s估算

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen2.5 3B Instruct

3B

Alibaba Qwen2.5

Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。

Q4_K_M · RTX 4090 · batch 1

2.1 GB

显存

32K

上下文

340

tok/s估算

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Llama 3.2 1B Instruct

1B

Meta Llama 3.2

超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。

Q4_K_M · RTX 4090 · batch 1

1.0 GB

显存

128K

上下文

520

tok/s估算

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Llama-70B

70B

DeepSeek

R1 推理能力注入 Llama 70B 架构,双卡部署的顶级开源推理模型。

Q4_K_M · RTX 4090 · batch 1

43.5 GB

显存

128K

上下文

—

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Codestral 22B

22B

Mistral AI

Mistral 专用代码模型,支持 80+ 编程语言,支持 Fill-in-the-Middle。

Q4_K_M · RTX 4090 · batch 1

14.8 GB

显存

32K

上下文

58

tok/s估算

可用格式

GGUFAWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 3.2 11B Vision Instruct

11B

Meta Llama 3.2

多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。

Q4_K_M · RTX 4090 · batch 1

9.5 GB

显存

128K

上下文

88

tok/s估算

可用格式

GGUF
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Nous Hermes 3 Llama 3.1 8B

8B

NousResearch

基于 Llama 3.1 8B 微调,角色扮演和指令遵循能力增强。

Q4_K_M · RTX 4090 · batch 1

5.7 GB

显存

128K

上下文

148

tok/s估算

可用格式

GGUFEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Granite 3.1 8B Instruct

8B

IBM Granite

IBM 企业级 8B 模型,RAG 和工具调用能力强,Apache 2.0 许可。

Q4_K_M · RTX 4090 · batch 1

5.8 GB

显存

128K

上下文

142

tok/s估算

可用格式

GGUFGPTQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen2.5 0.5B Instruct

0.5B

Alibaba Qwen2.5

最小 Qwen2.5,适合树莓派、手机端和超低延迟演示。

Q4_K_M · RTX 4090 · batch 1

0.6 GB

显存

32K

上下文

620

tok/s估算

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen2.5 1.5B Instruct

1.5B

Alibaba Qwen2.5

支持 128K 上下文的微型 Qwen,摘要和对话能力出人意料。

Q4_K_M · RTX 4090 · batch 1

1.4 GB

显存

128K

上下文

480

tok/s估算

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Phi-3 Medium 14B Instruct

14B

Microsoft Phi

Microsoft 中型 Phi-3,16GB 显卡上质量/显存比极佳。

Q4_K_M · RTX 4090 · batch 1

9.8 GB

显存

128K

上下文

102

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Phi-4 Mini Instruct

3.8B

Microsoft Phi

最新 Phi mini,数学和代码能力提升,4B 级性能强者。

Q4_K_M · RTX 4090 · batch 1

2.8 GB

显存

128K

上下文

305

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

DeepSeek-V2-Lite Chat

16B-A2.4B

DeepSeek

MoE 通用模型(激活约 2.4B),长上下文,多语言对话能力强。注意力采用 MLA:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b 张量)在 32K 下约缓存 1 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 8.4 GB。

Q4_K_M · RTX 4090 · batch 1

11.0 GB

显存

160K

上下文

142

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Qwen-7B

7B

DeepSeek

7B 体量的 R1 推理能力,8–12GB 显存思维链实验性价比最高。

Q4_K_M · RTX 4090 · batch 1

5.4 GB

显存

128K

上下文

152

tok/s估算

可用格式

GGUFEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Qwen-32B

32B

DeepSeek

R1 蒸馏至 32B,单卡 24GB(Q3/Q4)即可接近前沿推理能力。

Q4_K_M · RTX 4090 · batch 1

22.2 GB

显存

128K

上下文

42

tok/s估算

可用格式

GGUFEXL2
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 3.2 90B Vision Instruct

90B

Meta Llama 3.2

旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。

Q4_K_M · RTX 4090 · batch 1

54.8 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

Falcon 3 10B Instruct

10B

TII UAE

TII 最新 Falcon,多语言与代码能力均衡。

Q4_K_M · RTX 4090 · batch 1

7.0 GB

显存

32K

上下文

118

tok/s估算

可用格式

GGUFGPTQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Qwen3 8B Instruct

8B

Alibaba Qwen3

最新 Qwen3 稠密 8B,支持思考模式,本地部署比 Qwen2.5 7B 全面升级。

Q4_K_M · RTX 4090 · batch 1

5.8 GB

显存

40K

上下文

142

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen3 14B Instruct

14B

Alibaba Qwen3

Qwen3 14B — 2026 Qwen 系列中推理能力与显存占用的最佳平衡点。

Q4_K_M · RTX 4090 · batch 1

10.5 GB

显存

40K

上下文

88

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Gemma 3 4B IT

4B

Google Gemma 3

Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。

Q4_K_M · RTX 4090 · batch 1

3.4 GB

显存

128K

上下文

175

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Gemma 3 12B IT

12B

Google Gemma 3

中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。

Q4_K_M · RTX 4090 · batch 1

8.8 GB

显存

128K

上下文

105

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Llama 4 Scout 17B (16E)

109B MoE

Meta Llama 4

Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。

Q4_K_M · RTX 4090 · batch 1

68.0 GB

显存

10M

上下文

—

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 4 Maverick 17B (128E)

400B MoE

Meta Llama 4

Llama 4 Maverick 旗舰 MoE(激活 17B / 总 400B),需多卡或 H100 集群。

Q4_K_M · RTX 4090 · batch 1

245.0 GB

显存

1M

上下文

—

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 3.1 405B Instruct

405B

Meta Llama 3.1

Meta 前沿稠密 405B,Q4 约需 230GB+ 显存;双 H100 80G 或 8 卡消费级方案。

Q4_K_M · RTX 4090 · batch 1

238.0 GB

显存

128K

上下文

—

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 32B Instruct

32B

Alibaba Qwen3

Qwen3 稠密 32B — Qwen2.5-32B 继任者,推理与思考模式全面升级。

Q4_K_M · RTX 4090 · batch 1

22.5 GB

显存

40K

上下文

42

tok/s

可用格式

GGUFEXL2AWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 30B-A3B Instruct

30B-A3B

Alibaba Qwen3

Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。

Q4_K_M · RTX 4090 · batch 1

19.0 GB

显存

40K

上下文

95

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Qwen3 235B-A22B Instruct

235B-A22B

Alibaba Qwen3

Qwen3 旗舰 MoE(激活 22B / 总 235B)。Q4_K_M 约 142GB,对标 DeepSeek-R1 级模型。

Q4_K_M · RTX 4090 · batch 1

142.0 GB

显存

40K

上下文

—

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-V3

671B MoE

DeepSeek

DeepSeek-V3 前沿 MoE(激活约 37B / 总 671B)。MLA + FP8;Q4 需多节点 GPU 集群。MLA 缓存:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b)在 32K 下约 2 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 150 GB。

Q4_K_M · RTX 4090 · batch 1

385.0 GB

显存

160K

上下文

—

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-R1

671B MoE

DeepSeek

基于 V3 MoE 的 DeepSeek-R1 推理模型。前沿级思维链 — 本地 GPU 请用蒸馏版。MLA 缓存:用当前 llama.cpp 转换的 GGUF(含 attn_k_b / attn_v_b)在 32K 下约 2 GB,本站估算即按此计算;只有单个 attn_kv_b 张量的旧版转换会缓存完整的 K 和 V,32K 下约 150 GB。

Q4_K_M · RTX 4090 · batch 1

385.0 GB

显存

160K

上下文

—

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 4B Instruct

4B

Alibaba Qwen3

最小 Qwen3 稠密模型,支持思考模式。Q4 约 3.2GB,适合 8GB 显卡与边缘设备。

Q4_K_M · RTX 4090 · batch 1

3.2 GB

显存

32K

上下文

168

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen3-Coder 30B-A3B Instruct

30B-A3B

Alibaba Qwen3

Agentic 代码 MoE,3.3B 激活参数,原生 256K 上下文。16–24GB 显卡上最强开源代码模型之一。

Q4_K_M · RTX 4090 · batch 1

19.2 GB

显存

256K

上下文

92

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Mistral Large 3 675B Instruct

675B MoE

Mistral AI

Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。注意力为 DeepSeek 式 MLA,实际 KV 缓存比下方按常规结构(未核实)估算的数字小。32K 下相对约 390 GB 权重可忽略;用满 256K 时,请把缓存数字当作上限。

Q4_K_M · RTX 4090 · batch 1

388.0 GB

显存

256K

上下文

—

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

GLM-4-9B-Chat

9B

Zhipu GLM-4

智谱 GLM-4 开源 9B,128K 上下文,支持工具调用,中英双语表现突出。

Q4_K_M · RTX 4090 · batch 1

6.2 GB

显存

128K

上下文

135

tok/s估算

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Gemma 3 27B IT

27B

Google Gemma 3

Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。

Q4_K_M · RTX 4090 · batch 1

16.2 GB

显存

128K

上下文

48

tok/s社区

可用格式

GGUFAWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Llama-8B

8B

DeepSeek

R1 推理蒸馏到 Llama 3.1 8B。8–12GB 显卡上最佳思维链之一,社区 GGUF 极丰富。

Q4_K_M · RTX 4090 · batch 1

5.6 GB

显存

128K

上下文

145

tok/s社区

可用格式

GGUFEXL2AWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Phi-4 14B

14B

Microsoft Phi

微软 Phi-4 稠密 14B,同尺寸推理能力突出。Q4 约 9GB,12GB 卡中等上下文可跑。

Q4_K_M · RTX 4090 · batch 1

9.1 GB

显存

16K

上下文

88

tok/s社区

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Qwen3 1.7B Instruct

1.7B

Alibaba Qwen3

迷你 Qwen3,支持思考模式。Q4 约 1.4GB,适合手机旁路、NUC 与常驻本地 Agent。

Q4_K_M · RTX 4090 · batch 1

1.4 GB

显存

32K

上下文

280

tok/s社区

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

GPT-OSS 20B

21B MoE

OpenAI GPT-OSS

OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。

MXFP4 · RTX 4090 · batch 1

12.8 GB

显存

128K

上下文

195

tok/s社区

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF MXFP4
Hugging Face

GPT-OSS 120B

117B MoE

OpenAI GPT-OSS

GPT-OSS 大杯(总 117B / 激活 5.1B)。原生 MXFP4 权重约 61GB —— 单张 80GB 卡或 128GB 统一内存 Mac 可跑。24GB 消费卡部分卸载虽慢但可用。

MXFP4 · RTX 4090 · batch 1

61.0 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
专业 GPUMac / 苹果芯片
GGUF MXFP4
Hugging Face

GLM-4.5-Air

106B MoE

Zhipu GLM-4.5

智谱 Agent/推理向 MoE(总 106B / 激活 12B)。Q4 约 64GB —— 96GB+ 统一内存 Mac 或双 48GB 卡最合适。同级别中工具调用能力突出。

Q4_K_M · RTX 4090 · batch 1

64.3 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Devstral Small 1.1 24B

24B

Mistral Devstral

Mistral 与 All Hands 合作的 Agent 编码模型,基于 Mistral Small 3.1。面向仓库级工具调用而非单文件补全。Q4 约 14GB,16GB 显卡可跑。

Q4_K_M · RTX 4090 · batch 1

14.3 GB

显存

128K

上下文

62

tok/s社区

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Qwen3-VL 8B Instruct

8B

Alibaba Qwen3-VL

当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。

Q4_K_M · RTX 4090 · batch 1

5.9 GB

显存

40K

上下文

140

tok/s社区

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen3-VL 30B-A3B Instruct

30B-A3B

Alibaba Qwen3-VL

多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。

Q4_K_M · RTX 4090 · batch 1

19.0 GB

显存

40K

上下文

95

tok/s社区

可用格式

GGUFAWQ
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Magistral Small 1.2 24B

24B

Mistral Magistral

Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。

Q4_K_M · RTX 4090 · batch 1

14.3 GB

显存

128K

上下文

60

tok/s社区

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Seed-OSS 36B Instruct

36B

ByteDance Seed

稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。

Q4_K_M · RTX 4090 · batch 1

21.8 GB

显存

512K

上下文

42

tok/s社区

可用格式

GGUFAWQ
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Ministral 3 8B Instruct

8B
新

Mistral Ministral 3

Mistral 官方直接发布 GGUF,分 3B / 8B / 14B 与 Instruct、Reasoning 两种变体;其中 8B 在 Q4 下能装进 8GB 显卡并留出可用的上下文余量。34 层全部是标准全注意力,因此下方的显存估算与计算器的假设完全一致。各档位的质量损失官方未公布。

Q4_K_M · RTX 4090 · batch 1

5.2 GB

显存

256K

上下文

—

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Qwen3.8 27B

27B
新

Alibaba Qwen3.8

混合注意力:64 层中只有 16 层保留 KV 缓存,所以这个 27B 模型在 262K 上下文下的缓存约 16GB,而不是 64GB。按常规架构计算会把缓存高估四倍 —— 这里的估算只计入那 16 层,并与 8K、32K、262K 三个已公开实测值吻合。各档位的质量损失官方未公布。

Q4_K_M · RTX 4090 · batch 1

15.3 GB

显存

256K

上下文

—

tok/s

可用格式

GGUF
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

GLM-4.7-Flash

30B-A3B
新

Zhipu GLM-4.7

智谱 GLM-4.7 系列的轻量款:总参数 30B,每 token 激活约 3B,MIT 许可。注意力采用 MLA,每层每个 token 只缓存一个 576 维的压缩向量,而不是完整的 K 和 V——所以 32K 上下文下缓存不到 2 GB,常规 47 层模型需要的是它的好几倍。llama.cpp 按 DeepSeek-2 类模型运行它。下方体积使用计算器通用的 Q4_K_M / Q8_0 比特率:未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

18.2 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Kimi Linear 48B-A3B Instruct

48B-A3B
新

Moonshot Kimi Linear

月之暗面的混合线性注意力模型:总参数 48B,激活 3B,上下文窗口 100 万 token。27 层中只有 7 层保留会增长的缓存,而且存的是 MLA 压缩向量,所以即使用满 100 万 token,缓存也只要约 8 GB——决定它能在什么硬件上跑的是权重,不是上下文。Q4 下,48 GB 及以上的 Mac 可以从容运行;32 GB 显卡只能勉强装下、几乎不剩余量。下方体积使用计算器通用的比特率:未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

29.1 GB

显存

1M

上下文

—

tok/s

可用格式

GGUF
专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Gemma 4 26B-A4B IT

26B-A4B
新

Google Gemma 4

Google Gemma 4 的混合专家模型:文本部分约 25B 参数,每 token 激活约 4B,256K 上下文,支持图像输入。30 层中只有 5 层的缓存随上下文增长,而且这些层用的是更少、更宽的注意力头,所以缓存很小——32K 下约 0.9 GB,用满 256K 也只要约 5.3 GB。Q4 下 32K 上下文约 17 GB:24 GB 显卡可以从容运行,甚至能加载完整窗口(偏紧)。16 GB 显卡差一点装不下。下方体积使用计算器通用比特率——未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

15.3 GB

显存

256K

上下文

—

tok/s

可用格式

GGUF
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Gemma 4 31B IT

31B
新

Google Gemma 4

Google Gemma 4 的稠密旗舰:约 31B 参数,256K 上下文,支持图像输入。60 层中只有 10 层缓存完整上下文,而且这些层只用 4 个宽 KV 头,所以 128K 上下文只增加约 11 GB 缓存,常规的 60 层结构则要约 120 GB。Q4 下 4K 上下文约 21 GB——在 24 GB 显卡上刚好压在"从容"的边缘,32K 起就偏紧;32 GB 显卡跑 32K 很从容。下方体积使用计算器通用比特率——未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

18.6 GB

显存

256K

上下文

—

tok/s

可用格式

GGUF
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Gemma 4 E4B IT

E4B
新

Google Gemma 4

Google 面向端侧的 Gemma 4:实际参与计算的约 4.7B 参数,外加一张 2.8B 的逐层嵌入表,128K 上下文,支持图像和音频输入。42 层中只有 4 层的缓存随上下文增长,所以用满 128K 也只要约 2.0 GB 缓存。Q4 下 4K 上下文约 4.9 GB,用满窗口约 7.0 GB——日常上下文长度下 8 GB 显卡可以从容运行。这里的体积按整个模型都放进 GPU 内存计算,也就是 Mac 或整模型上 GPU 时的占用;llama.cpp 会把嵌入表留在系统内存,所以在独立显卡上,Q4 实际显存占用比这里少约 1.6 GB。体积使用计算器通用比特率——未能核对到 GGUF 文件大小。

Q4_K_M · RTX 4090 · batch 1

4.6 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Gemma 4 E2B IT

E2B
新

Google Gemma 4

最小的 Gemma 4:实际参与计算的约 2.3B 参数,外加一张 2.3B 的逐层嵌入表,128K 上下文,支持图像和音频输入。它的缓存几乎不增长——35 层中只有 3 层跟踪完整上下文,128K 下约 0.8 GB。Q4 下 4K 上下文约 3.0 GB,用满窗口约 3.8 GB——本索引中任何一张卡、以及 8 GB 的 Mac 都能从容运行。体积按整个模型都放进 GPU 内存计算;llama.cpp 会把嵌入表留在系统内存,所以在独立显卡上,Q4 实际显存占用比这里少约 1.3 GB。体积使用计算器通用比特率——未能核对到 GGUF 文件大小。

Q4_K_M · RTX 4090 · batch 1

2.8 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

SmolLM3 3B

3B
新

Hugging Face SmolLM

Hugging Face 完全开源的 3B 模型,训练数据和训练方法随权重一起公开。它带一个可开关的推理模式,实际训练到的上下文窗口是 64K,128K 要靠 YaRN 外推。只有 4 个 KV 头,缓存很小,所以长窗口也负担得起:Q4_K_M 下短上下文能放进 4 GB 显卡,用满训练窗口也能放进 8 GB 显卡。这也让它成为本站少数在纯 CPU 机器上也现实可用的模型之一。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

2.3 GB

显存

64K

上下文

—

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

ERNIE 4.5 21B-A3B

21B-A3B
新

Baidu ERNIE 4.5

百度开源的混合专家模型:总参数约 21.8B,每个 token 约激活 3B,由 64 个路由专家(每个 token 选 6 个)加 2 个共享专家组成。总参数决定显存,激活参数决定速度,所以它需要 20B 级模型的显存,每个 token 读取的数据量却和 3B 模型差不多。Q4_K_M 在 4K 上下文下约需 14.1 GB,在 16 GB 显卡上正好处于“宽裕”的边缘,到 32K 就偏紧了;24 GB 显卡,或 24 GB 的 Mac(靠 GPU 可用的那部分统一内存)才有真正的上下文余量。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

14.1 GB

显存

128K

上下文

—

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

OLMo 3 7B Instruct

7B
新

Allen AI OLMo

Allen AI 完全开源的 7B 模型,训练数据、代码和中间检查点一并公开。上一代只有 4K 上下文,OLMo 3 达到 64K(由 8K 基础通过 YaRN 扩展而来)。每四层中有三层使用 4K 滑动窗口,这正是长上下文负担得起的原因。不过它仍是完整的多头注意力,没有共享 KV 头,所以长上下文的代价比大多数 7B–8B 模型高。Q4_K_M 在 4K 上下文下约需 6.8 GB,32K 下约 10.9 GB;如果没有滑动窗口,32K 需要约 22 GB。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。

Q4_K_M · RTX 4090 · batch 1

6.8 GB

显存

64K

上下文

—

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face