量化模型库

开源量化模型结构化索引 — 不托管文件,只提供精准元数据 · 索引共 79 个模型

数据更新于 2026-09-01

79 个模型35 个系列4 种量化格式≤3B · 107B · 1914B · 1732B · 1870B+ · 15

按 GPU 一键筛选(4K 上下文)

参数量

用途分类

目标硬件

量化格式

时效

79 / 79 个模型

正在显示全部 79 个模型

Llama 3.1 8B Instruct

8B

Meta Llama 3.1

Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。

3.2 GB

最低显存

131K

上下文

235

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Llama 3.1 70B Instruct

70B

Meta Llama 3.1

Meta 前沿 70B 模型,需要 40GB+ 显存,适合双 3090 或 M2 Ultra。

33.4 GB

最低显存

131K

上下文

62

tok/s

可用格式

GGUFAWQEXL2
专业 GPUMac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Llama 3.2 3B Instruct

3B

Meta Llama 3.2

小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。

2.0 GB

最低显存

131K

上下文

420

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Qwen2.5 7B Instruct

7B

Alibaba Qwen2.5

阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。

4.8 GB

最低显存

131K

上下文

245

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q6_K
Hugging Face

Qwen2.5 14B Instruct

14B

Alibaba Qwen2.5

性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。

9.2 GB

最低显存

131K

上下文

138

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Qwen2.5 32B Instruct

32B

Alibaba Qwen2.5

24GB 显存单卡可运行 Q4_K_S,推理能力接近 GPT-4,性价比极高。

16.4 GB

最低显存

131K

上下文

68

tok/s

可用格式

GGUFEXL2
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-Coder-V2-Lite Instruct

16B

DeepSeek

MoE 架构代码模型,激活参数约 2.4B,代码能力卓越。

9.8 GB

最低显存

164K

上下文

192

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q8_0
Hugging Face

Phi-3.5 Mini Instruct

3.8B

Microsoft Phi

Microsoft 的小巧精悍之作,端侧部署最佳 4B 模型之一。

2.5 GB

最低显存

131K

上下文

385

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Mistral Nemo 12B Instruct

12B

Mistral AI

Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。

7.8 GB

最低显存

131K

上下文

148

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q6_K
Hugging Face

Gemma 2 9B Instruct

9B

Google Gemma 2

Google Gemma 2 采用滑动窗口注意力机制,性能超越同级 9B 模型。

5.8 GB

最低显存

8K

上下文

188

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q8_0
Hugging Face

Qwen2.5 72B Instruct

72B

Alibaba Qwen2.5

Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。

33.8 GB

最低显存

131K

上下文

48

tok/s

可用格式

GGUFAWQEXL2
专业 GPU
GGUF Q5_K_M
Hugging Face

DeepSeek-R1-Distill-Qwen-14B

14B

DeepSeek

R1 推理能力蒸馏至 14B,社区热度极高,思维链能力出色。

9.2 GB

最低显存

131K

上下文

128

tok/s

可用格式

GGUFEXL2AWQ
消费级显卡
EXL2 4.65bpw
Hugging Face

Llama 3.3 70B Instruct

70B

Meta Llama 3.3

Meta 最新 70B,多语言能力提升,可无缝替换 Llama 3.1 70B。

38.2 GB

最低显存

131K

上下文

54

tok/s

可用格式

GGUFAWQ
专业 GPUMac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Mistral Small 24B Instruct

24B

Mistral AI

Mistral 高效 24B 模型,多语言能力强,Q4 量化可装入 24GB 显存。

13.5 GB

最低显存

33K

上下文

88

tok/s

可用格式

GGUFAWQEXL2
消费级显卡专业 GPU
EXL2 4.65bpw
Hugging Face

Qwen2.5-Coder 32B Instruct

32B

Alibaba Qwen2.5

顶级开源代码模型,HumanEval 在 32B 规模可与 GPT-4o 竞争。

16.4 GB

最低显存

131K

上下文

65

tok/s

可用格式

GGUFEXL2AWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen2.5-Coder 7B Instruct

7B

Alibaba Qwen2.5

最佳 7B 代码模型,适合 8–16GB 显存的本地开发助手。

4.8 GB

最低显存

131K

上下文

248

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
EXL2 4.65bpw
Hugging Face

Qwen2.5 3B Instruct

3B

Alibaba Qwen2.5

Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。

2.1 GB

最低显存

33K

上下文

340

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Llama 3.2 1B Instruct

1B

Meta Llama 3.2

超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。

1.0 GB

最低显存

131K

上下文

520

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

DeepSeek-R1-Distill-Llama-70B

70B

DeepSeek

R1 推理能力注入 Llama 70B 架构,双卡部署的顶级开源推理模型。

38.2 GB

最低显存

131K

上下文

52

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Codestral 22B

22B

Mistral AI

Mistral 专用代码模型,支持 80+ 编程语言,支持 Fill-in-the-Middle。

13.2 GB

最低显存

33K

上下文

72

tok/s

可用格式

GGUFAWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Mixtral 8x7B Instruct

47B MoE

Mistral AI

经典 MoE 模型,每 token 约 13B 激活参数,Q4 量化需 32GB+ 显存。

25.2 GB

最低显存

33K

上下文

62

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Command R 35B

35B

Cohere

Cohere RAG 优化模型,检索增强生成能力出色。

20.5 GB

最低显存

131K

上下文

55

tok/s

可用格式

GGUFGPTQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Yi 1.5 34B Chat

34B
已过时

01.AI Yi

建议改用 Qwen3 32B Instruct

01.AI 强力中英双语模型,性能与 Qwen 32B 相当。

19.8 GB

最低显存

4K

上下文

52

tok/s

可用格式

GGUFAWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Solar 10.7B Instruct

11B
已过时

Upstage

建议改用 Qwen3 14B Instruct

深度扩展 10.7B 模型,性能超越参数量,推理基准表现出色。

6.5 GB

最低显存

4K

上下文

168

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

StarCoder2 15B

15B

BigCode

BigCode 开源代码模型,训练覆盖 600+ 语言,适合多语言开发。

9.2 GB

最低显存

16K

上下文

115

tok/s

可用格式

GGUFGPTQ
消费级显卡
GGUF Q4_K_M
Hugging Face

Llama 3.2 11B Vision Instruct

11B

Meta Llama 3.2

多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。

9.5 GB

最低显存

131K

上下文

88

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片
GGUF Q8_0
Hugging Face

Qwen2-VL 7B Instruct

7B
已过时

Alibaba Qwen2

建议改用 Qwen3-VL 8B Instruct

视觉语言模型,支持视频理解,OCR 和图表阅读能力出色。

6.0 GB

最低显存

33K

上下文

95

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Nous Hermes 3 Llama 3.1 8B

8B

NousResearch

基于 Llama 3.1 8B 微调,角色扮演和指令遵循能力增强。

5.4 GB

最低显存

131K

上下文

232

tok/s

可用格式

GGUFEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
EXL2 4.65bpw
Hugging Face

WizardLM-2 7B

7B
已过时

Microsoft / WizardLM

建议改用 Qwen3 8B Instruct

Evol-Instruct 微调的 Mistral 系 7B,复杂指令处理能力出色。

4.8 GB

最低显存

33K

上下文

218

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Granite 3.1 8B Instruct

8B

IBM Granite

IBM 企业级 8B 模型,RAG 和工具调用能力强,Apache 2.0 许可。

5.0 GB

最低显存

131K

上下文

195

tok/s

可用格式

GGUFGPTQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

Gemma 2 2B Instruct

2B

Google Gemma 2

超紧凑 Gemma 2,4GB 显存即可运行,适合边缘原型开发。

1.8 GB

最低显存

8K

上下文

450

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Gemma 2 27B Instruct

27B

Google Gemma 2

最大开源 Gemma 2,推理能力强,Q4 量化需 24GB+ 显存。

16.2 GB

最低显存

8K

上下文

58

tok/s

可用格式

GGUFAWQ
消费级显卡专业 GPU
GGUF Q5_K_M
Hugging Face

Qwen2.5 0.5B Instruct

0.5B

Alibaba Qwen2.5

最小 Qwen2.5,适合树莓派、手机端和超低延迟演示。

0.6 GB

最低显存

33K

上下文

620

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Qwen2.5 1.5B Instruct

1.5B

Alibaba Qwen2.5

支持 128K 上下文的微型 Qwen,摘要和对话能力出人意料。

1.4 GB

最低显存

131K

上下文

480

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Phi-3 Medium 14B Instruct

14B

Microsoft Phi

Microsoft 中型 Phi-3,16GB 显卡上质量/显存比极佳。

8.8 GB

最低显存

131K

上下文

135

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q6_K
Hugging Face

Phi-4 Mini Instruct

3.8B

Microsoft Phi

最新 Phi mini,数学和代码能力提升,4B 级性能强者。

2.5 GB

最低显存

131K

上下文

395

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Mistral 7B Instruct v0.3

7B

Mistral AI

经典 Mistral 7B v0.3,仍是本地对话 API 的可靠基线。

4.6 GB

最低显存

33K

上下文

225

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q6_K
Hugging Face

DeepSeek-V2-Lite Chat

16B

DeepSeek

MoE 通用模型(激活约 2.4B),长上下文,多语言对话能力强。

9.6 GB

最低显存

164K

上下文

188

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Qwen-7B

7B

DeepSeek

7B 体量的 R1 推理能力,8–12GB 显存思维链实验性价比最高。

5.2 GB

最低显存

131K

上下文

210

tok/s

可用格式

GGUFEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
EXL2 4.65bpw
Hugging Face

DeepSeek-R1-Distill-Qwen-32B

32B

DeepSeek

R1 蒸馏至 32B,单卡 24GB(Q3/Q4)即可接近前沿推理能力。

16.8 GB

最低显存

131K

上下文

65

tok/s

可用格式

GGUFEXL2
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 3.2 90B Vision Instruct

90B

Meta Llama 3.2

旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。

44.2 GB

最低显存

131K

上下文

28

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

OLMo 2 7B Instruct

7B

Allen AI OLMo

Allen AI 全开放训练管线,适合可复现性研究。

5.3 GB

最低显存

4K

上下文

150

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

InternLM2 7B Chat

7B

Shanghai AI Lab

上海 AI Lab 强力中英双语 7B,性能与 Qwen 7B 相当。

4.9 GB

最低显存

33K

上下文

215

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

InternLM2 20B Chat

20B

Shanghai AI Lab

中型 InternLM2,中文理解出色,Q4 量化可装入 24GB 显存。

13.8 GB

最低显存

33K

上下文

78

tok/s

可用格式

GGUF
消费级显卡专业 GPU
GGUF Q5_K_M
Hugging Face

Aya 23 8B

8B

Cohere For AI

覆盖 23 种语言的多语言专家,适合非英语本地应用。

5.0 GB

最低显存

8K

上下文

205

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q4_K_M
Hugging Face

OpenChat 3.6 8B

8B
已过时

OpenChat

建议改用 Qwen3 8B Instruct

C-RLFT 微调的 Llama 3.1 8B,对话语气自然流畅。

5.4 GB

最低显存

8K

上下文

228

tok/s

可用格式

GGUFEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
EXL2 4.65bpw
Hugging Face

Zephyr 7B Beta

7B
已过时

HuggingFaceH4

建议改用 Qwen3 8B Instruct

DPO 对齐的 Mistral 7B,友善无害对话基线的经典选择。

5.2 GB

最低显存

33K

上下文

155

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q6_K
Hugging Face

Stable LM 2 12B Chat

12B

Stability AI

Stability AI 12B 对话模型,16GB 显卡通用之选。

7.2 GB

最低显存

4K

上下文

142

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Falcon 3 10B Instruct

10B

TII UAE

TII 最新 Falcon,多语言与代码能力均衡。

6.2 GB

最低显存

33K

上下文

155

tok/s

可用格式

GGUFGPTQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Jamba 1.5 Mini

12B

AI21 Labs

SSM-Transformer 混合架构,256K 上下文,16GB 显存可做长文档问答。

7.5 GB

最低显存

262K

上下文

125

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q4_K_M
Hugging Face

DBRX Instruct

132B

Databricks

MoE 旗舰(激活约 36B),需多卡;大规模代码与推理能力强。

63.2 GB

最低显存

33K

上下文

18

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 8B Instruct

8B

Alibaba Qwen3

最新 Qwen3 稠密 8B,支持思考模式,本地部署比 Qwen2.5 7B 全面升级。

5.1 GB

最低显存

41K

上下文

228

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q6_K
Hugging Face

Qwen3 14B Instruct

14B

Alibaba Qwen3

Qwen3 14B — 2026 Qwen 系列中推理能力与显存占用的最佳平衡点。

9.5 GB

最低显存

41K

上下文

125

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Gemma 3 4B IT

4B

Google Gemma 3

Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。

3.0 GB

最低显存

131K

上下文

210

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Gemma 3 12B IT

12B

Google Gemma 3

中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。

8.0 GB

最低显存

131K

上下文

128

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Llama 4 Scout 17B (16E)

109B MoE

Meta Llama 4

Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。

55.0 GB

最低显存

10486K

上下文

28

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 4 Maverick 17B (128E)

400B MoE

Meta Llama 4

Llama 4 Maverick 旗舰 MoE(激活 17B / 总 400B),需多卡或 H100 集群。

198.0 GB

最低显存

1049K

上下文

10

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

Llama 3.1 405B Instruct

405B

Meta Llama 3.1

Meta 前沿稠密 405B,Q4 约需 230GB+ 显存;双 H100 80G 或 8 卡消费级方案。

192.0 GB

最低显存

131K

上下文

10

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 32B Instruct

32B

Alibaba Qwen3

Qwen3 稠密 32B — Qwen2.5-32B 继任者,推理与思考模式全面升级。

16.8 GB

最低显存

41K

上下文

62

tok/s

可用格式

GGUFEXL2AWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 30B-A3B Instruct

30B-A3B

Alibaba Qwen3

Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。

17.5 GB

最低显存

41K

上下文

118

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Qwen3 235B-A22B Instruct

235B-A22B

Alibaba Qwen3

Qwen3 旗舰 MoE(激活 22B / 总 235B)。Q4_K_M 约 142GB,对标 DeepSeek-R1 级模型。

115.0 GB

最低显存

41K

上下文

14

tok/s

可用格式

GGUFAWQ
专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-V3

671B MoE

DeepSeek

DeepSeek-V3 前沿 MoE(激活约 37B / 总 671B)。MLA + FP8;Q4 需多节点 GPU 集群。

310.0 GB

最低显存

164K

上下文

5

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-R1

671B MoE

DeepSeek

基于 V3 MoE 的 DeepSeek-R1 推理模型。前沿级思维链 — 本地 GPU 请用蒸馏版。

310.0 GB

最低显存

164K

上下文

5

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

Qwen3 4B Instruct

4B

Alibaba Qwen3

最小 Qwen3 稠密模型,支持思考模式。Q4 约 3.2GB,适合 8GB 显卡与边缘设备。

2.8 GB

最低显存

33K

上下文

248

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q6_K
Hugging Face

Qwen3-Coder 30B-A3B Instruct

30B-A3B

Alibaba Qwen3

Agentic 代码 MoE,3.3B 激活参数,原生 256K 上下文。16–24GB 显卡上最强开源代码模型之一。

17.8 GB

最低显存

262K

上下文

115

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Mistral Large 3 675B Instruct

675B MoE

Mistral AI

Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。

312.0 GB

最低显存

262K

上下文

5

tok/s

可用格式

GGUF
专业 GPU
GGUF Q4_K_M
Hugging Face

GLM-4-9B-Chat

9B

Zhipu GLM-4

智谱 GLM-4 开源 9B,128K 上下文,支持工具调用,中英双语表现突出。

5.5 GB

最低显存

131K

上下文

178

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q8_0
Hugging Face

Gemma 3 27B IT

27B

Google Gemma 3

Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。

13.0 GB

最低显存

131K

上下文

62

tok/s

可用格式

GGUFAWQ
消费级显卡专业 GPU
GGUF Q4_K_M
Hugging Face

DeepSeek-R1-Distill-Llama-8B

8B

DeepSeek

R1 推理蒸馏到 Llama 3.1 8B。8–12GB 显卡上最佳思维链之一,社区 GGUF 极丰富。

4.9 GB

最低显存

131K

上下文

210

tok/s

可用格式

GGUFEXL2AWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q5_K_M
Hugging Face

Phi-4 14B

14B

Microsoft Phi

微软 Phi-4 稠密 14B,同尺寸推理能力突出。Q4 约 9GB,12GB 卡中等上下文可跑。

8.2 GB

最低显存

16K

上下文

112

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片
GGUF Q5_K_M
Hugging Face

Qwen3 1.7B Instruct

1.7B

Alibaba Qwen3

迷你 Qwen3,支持思考模式。Q4 约 1.4GB,适合手机旁路、NUC 与常驻本地 Agent。

1.2 GB

最低显存

33K

上下文

320

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

GPT-OSS 20B

21B MoE

OpenAI GPT-OSS

OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。

11.9 GB

最低显存

131K

上下文

205

tok/s

可用格式

GGUF
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF MXFP4
Hugging Face

GPT-OSS 120B

117B MoE

OpenAI GPT-OSS

GPT-OSS 大杯(总 117B / 激活 5.1B)。原生 MXFP4 权重约 61GB —— 单张 80GB 卡或 128GB 统一内存 Mac 可跑。24GB 消费卡部分卸载虽慢但可用。

58.5 GB

最低显存

131K

上下文

24

tok/s

可用格式

GGUF
专业 GPUMac / 苹果芯片
GGUF MXFP4
Hugging Face

GLM-4.5-Air

106B MoE

Zhipu GLM-4.5

智谱 Agent/推理向 MoE(总 106B / 激活 12B)。Q4 约 64GB —— 96GB+ 统一内存 Mac 或双 48GB 卡最合适。同级别中工具调用能力突出。

34.8 GB

最低显存

131K

上下文

26

tok/s

可用格式

GGUF
专业 GPUMac / 苹果芯片
GGUF Q4_K_M
Hugging Face

Devstral Small 1.1 24B

24B

Mistral Devstral

Mistral 与 All Hands 合作的 Agent 编码模型,基于 Mistral Small 3.1。面向仓库级工具调用而非单文件补全。Q4 约 14GB,16GB 显卡可跑。

13.0 GB

最低显存

131K

上下文

88

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q6_K
Hugging Face

Qwen3-VL 8B Instruct

8B

Alibaba Qwen3-VL

当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。

5.3 GB

最低显存

41K

上下文

165

tok/s

可用格式

GGUFAWQ
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
GGUF Q8_0
Hugging Face

Qwen3-VL 30B-A3B Instruct

30B-A3B

Alibaba Qwen3-VL

多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。

15.2 GB

最低显存

41K

上下文

112

tok/s

可用格式

GGUFAWQ
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q8_0
Hugging Face

Magistral Small 1.2 24B

24B

Mistral Magistral

Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。

13.0 GB

最低显存

131K

上下文

86

tok/s

可用格式

GGUFAWQEXL2
消费级显卡Mac / 苹果芯片
GGUF Q6_K
Hugging Face

Seed-OSS 36B Instruct

36B

ByteDance Seed

稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。

17.4 GB

最低显存

524K

上下文

55

tok/s

可用格式

GGUFAWQ
消费级显卡专业 GPUMac / 苹果芯片
GGUF Q5_K_M
Hugging Face