量化模型库
开源量化模型结构化索引 — 不托管文件,只提供精准元数据 · 索引共 79 个模型
数据更新于 2026-09-01
按 GPU 一键筛选(4K 上下文)
参数量
用途分类
目标硬件
量化格式
时效
79 / 79 个模型
正在显示全部 79 个模型
Llama 3.1 8B Instruct
8BMeta Llama 3.1
Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。
3.2 GB
最低显存
131K
上下文
235
tok/s
可用格式
Llama 3.1 70B Instruct
70BMeta Llama 3.1
Meta 前沿 70B 模型,需要 40GB+ 显存,适合双 3090 或 M2 Ultra。
33.4 GB
最低显存
131K
上下文
62
tok/s
可用格式
Llama 3.2 3B Instruct
3BMeta Llama 3.2
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
2.0 GB
最低显存
131K
上下文
420
tok/s
可用格式
Qwen2.5 7B Instruct
7BAlibaba Qwen2.5
阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。
4.8 GB
最低显存
131K
上下文
245
tok/s
可用格式
Qwen2.5 14B Instruct
14BAlibaba Qwen2.5
性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。
9.2 GB
最低显存
131K
上下文
138
tok/s
可用格式
Qwen2.5 32B Instruct
32BAlibaba Qwen2.5
24GB 显存单卡可运行 Q4_K_S,推理能力接近 GPT-4,性价比极高。
16.4 GB
最低显存
131K
上下文
68
tok/s
可用格式
DeepSeek-Coder-V2-Lite Instruct
16BDeepSeek
MoE 架构代码模型,激活参数约 2.4B,代码能力卓越。
9.8 GB
最低显存
164K
上下文
192
tok/s
可用格式
Phi-3.5 Mini Instruct
3.8BMicrosoft Phi
Microsoft 的小巧精悍之作,端侧部署最佳 4B 模型之一。
2.5 GB
最低显存
131K
上下文
385
tok/s
可用格式
Mistral Nemo 12B Instruct
12BMistral AI
Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。
7.8 GB
最低显存
131K
上下文
148
tok/s
可用格式
Gemma 2 9B Instruct
9BGoogle Gemma 2
Google Gemma 2 采用滑动窗口注意力机制,性能超越同级 9B 模型。
5.8 GB
最低显存
8K
上下文
188
tok/s
可用格式
Qwen2.5 72B Instruct
72BAlibaba Qwen2.5
Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。
33.8 GB
最低显存
131K
上下文
48
tok/s
可用格式
DeepSeek-R1-Distill-Qwen-14B
14BDeepSeek
R1 推理能力蒸馏至 14B,社区热度极高,思维链能力出色。
9.2 GB
最低显存
131K
上下文
128
tok/s
可用格式
Llama 3.3 70B Instruct
70BMeta Llama 3.3
Meta 最新 70B,多语言能力提升,可无缝替换 Llama 3.1 70B。
38.2 GB
最低显存
131K
上下文
54
tok/s
可用格式
Mistral Small 24B Instruct
24BMistral AI
Mistral 高效 24B 模型,多语言能力强,Q4 量化可装入 24GB 显存。
13.5 GB
最低显存
33K
上下文
88
tok/s
可用格式
Qwen2.5-Coder 32B Instruct
32BAlibaba Qwen2.5
顶级开源代码模型,HumanEval 在 32B 规模可与 GPT-4o 竞争。
16.4 GB
最低显存
131K
上下文
65
tok/s
可用格式
Qwen2.5-Coder 7B Instruct
7BAlibaba Qwen2.5
最佳 7B 代码模型,适合 8–16GB 显存的本地开发助手。
4.8 GB
最低显存
131K
上下文
248
tok/s
可用格式
Qwen2.5 3B Instruct
3BAlibaba Qwen2.5
Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。
2.1 GB
最低显存
33K
上下文
340
tok/s
可用格式
Llama 3.2 1B Instruct
1BMeta Llama 3.2
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
1.0 GB
最低显存
131K
上下文
520
tok/s
可用格式
DeepSeek-R1-Distill-Llama-70B
70BDeepSeek
R1 推理能力注入 Llama 70B 架构,双卡部署的顶级开源推理模型。
38.2 GB
最低显存
131K
上下文
52
tok/s
可用格式
Codestral 22B
22BMistral AI
Mistral 专用代码模型,支持 80+ 编程语言,支持 Fill-in-the-Middle。
13.2 GB
最低显存
33K
上下文
72
tok/s
可用格式
Mixtral 8x7B Instruct
47B MoEMistral AI
经典 MoE 模型,每 token 约 13B 激活参数,Q4 量化需 32GB+ 显存。
25.2 GB
最低显存
33K
上下文
62
tok/s
可用格式
Command R 35B
35BCohere
Cohere RAG 优化模型,检索增强生成能力出色。
20.5 GB
最低显存
131K
上下文
55
tok/s
可用格式
Yi 1.5 34B Chat
34B01.AI Yi
建议改用 Qwen3 32B Instruct
01.AI 强力中英双语模型,性能与 Qwen 32B 相当。
19.8 GB
最低显存
4K
上下文
52
tok/s
可用格式
Solar 10.7B Instruct
11BUpstage
建议改用 Qwen3 14B Instruct
深度扩展 10.7B 模型,性能超越参数量,推理基准表现出色。
6.5 GB
最低显存
4K
上下文
168
tok/s
可用格式
StarCoder2 15B
15BBigCode
BigCode 开源代码模型,训练覆盖 600+ 语言,适合多语言开发。
9.2 GB
最低显存
16K
上下文
115
tok/s
可用格式
Llama 3.2 11B Vision Instruct
11BMeta Llama 3.2
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
9.5 GB
最低显存
131K
上下文
88
tok/s
可用格式
Qwen2-VL 7B Instruct
7BAlibaba Qwen2
建议改用 Qwen3-VL 8B Instruct
视觉语言模型,支持视频理解,OCR 和图表阅读能力出色。
6.0 GB
最低显存
33K
上下文
95
tok/s
可用格式
Nous Hermes 3 Llama 3.1 8B
8BNousResearch
基于 Llama 3.1 8B 微调,角色扮演和指令遵循能力增强。
5.4 GB
最低显存
131K
上下文
232
tok/s
可用格式
WizardLM-2 7B
7BMicrosoft / WizardLM
建议改用 Qwen3 8B Instruct
Evol-Instruct 微调的 Mistral 系 7B,复杂指令处理能力出色。
4.8 GB
最低显存
33K
上下文
218
tok/s
可用格式
Granite 3.1 8B Instruct
8BIBM Granite
IBM 企业级 8B 模型,RAG 和工具调用能力强,Apache 2.0 许可。
5.0 GB
最低显存
131K
上下文
195
tok/s
可用格式
Gemma 2 2B Instruct
2BGoogle Gemma 2
超紧凑 Gemma 2,4GB 显存即可运行,适合边缘原型开发。
1.8 GB
最低显存
8K
上下文
450
tok/s
可用格式
Gemma 2 27B Instruct
27BGoogle Gemma 2
最大开源 Gemma 2,推理能力强,Q4 量化需 24GB+ 显存。
16.2 GB
最低显存
8K
上下文
58
tok/s
可用格式
Qwen2.5 0.5B Instruct
0.5BAlibaba Qwen2.5
最小 Qwen2.5,适合树莓派、手机端和超低延迟演示。
0.6 GB
最低显存
33K
上下文
620
tok/s
可用格式
Qwen2.5 1.5B Instruct
1.5BAlibaba Qwen2.5
支持 128K 上下文的微型 Qwen,摘要和对话能力出人意料。
1.4 GB
最低显存
131K
上下文
480
tok/s
可用格式
Phi-3 Medium 14B Instruct
14BMicrosoft Phi
Microsoft 中型 Phi-3,16GB 显卡上质量/显存比极佳。
8.8 GB
最低显存
131K
上下文
135
tok/s
可用格式
Phi-4 Mini Instruct
3.8BMicrosoft Phi
最新 Phi mini,数学和代码能力提升,4B 级性能强者。
2.5 GB
最低显存
131K
上下文
395
tok/s
可用格式
Mistral 7B Instruct v0.3
7BMistral AI
经典 Mistral 7B v0.3,仍是本地对话 API 的可靠基线。
4.6 GB
最低显存
33K
上下文
225
tok/s
可用格式
DeepSeek-V2-Lite Chat
16BDeepSeek
MoE 通用模型(激活约 2.4B),长上下文,多语言对话能力强。
9.6 GB
最低显存
164K
上下文
188
tok/s
可用格式
DeepSeek-R1-Distill-Qwen-7B
7BDeepSeek
7B 体量的 R1 推理能力,8–12GB 显存思维链实验性价比最高。
5.2 GB
最低显存
131K
上下文
210
tok/s
可用格式
DeepSeek-R1-Distill-Qwen-32B
32BDeepSeek
R1 蒸馏至 32B,单卡 24GB(Q3/Q4)即可接近前沿推理能力。
16.8 GB
最低显存
131K
上下文
65
tok/s
可用格式
Llama 3.2 90B Vision Instruct
90BMeta Llama 3.2
旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。
44.2 GB
最低显存
131K
上下文
28
tok/s
可用格式
OLMo 2 7B Instruct
7BAllen AI OLMo
Allen AI 全开放训练管线,适合可复现性研究。
5.3 GB
最低显存
4K
上下文
150
tok/s
可用格式
InternLM2 7B Chat
7BShanghai AI Lab
上海 AI Lab 强力中英双语 7B,性能与 Qwen 7B 相当。
4.9 GB
最低显存
33K
上下文
215
tok/s
可用格式
InternLM2 20B Chat
20BShanghai AI Lab
中型 InternLM2,中文理解出色,Q4 量化可装入 24GB 显存。
13.8 GB
最低显存
33K
上下文
78
tok/s
可用格式
Aya 23 8B
8BCohere For AI
覆盖 23 种语言的多语言专家,适合非英语本地应用。
5.0 GB
最低显存
8K
上下文
205
tok/s
可用格式
OpenChat 3.6 8B
8BOpenChat
建议改用 Qwen3 8B Instruct
C-RLFT 微调的 Llama 3.1 8B,对话语气自然流畅。
5.4 GB
最低显存
8K
上下文
228
tok/s
可用格式
Zephyr 7B Beta
7BHuggingFaceH4
建议改用 Qwen3 8B Instruct
DPO 对齐的 Mistral 7B,友善无害对话基线的经典选择。
5.2 GB
最低显存
33K
上下文
155
tok/s
可用格式
Stable LM 2 12B Chat
12BStability AI
Stability AI 12B 对话模型,16GB 显卡通用之选。
7.2 GB
最低显存
4K
上下文
142
tok/s
可用格式
Falcon 3 10B Instruct
10BTII UAE
TII 最新 Falcon,多语言与代码能力均衡。
6.2 GB
最低显存
33K
上下文
155
tok/s
可用格式
Jamba 1.5 Mini
12BAI21 Labs
SSM-Transformer 混合架构,256K 上下文,16GB 显存可做长文档问答。
7.5 GB
最低显存
262K
上下文
125
tok/s
可用格式
DBRX Instruct
132BDatabricks
MoE 旗舰(激活约 36B),需多卡;大规模代码与推理能力强。
63.2 GB
最低显存
33K
上下文
18
tok/s
可用格式
Qwen3 8B Instruct
8BAlibaba Qwen3
最新 Qwen3 稠密 8B,支持思考模式,本地部署比 Qwen2.5 7B 全面升级。
5.1 GB
最低显存
41K
上下文
228
tok/s
可用格式
Qwen3 14B Instruct
14BAlibaba Qwen3
Qwen3 14B — 2026 Qwen 系列中推理能力与显存占用的最佳平衡点。
9.5 GB
最低显存
41K
上下文
125
tok/s
可用格式
Gemma 3 4B IT
4BGoogle Gemma 3
Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。
3.0 GB
最低显存
131K
上下文
210
tok/s
可用格式
Gemma 3 12B IT
12BGoogle Gemma 3
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
8.0 GB
最低显存
131K
上下文
128
tok/s
可用格式
Llama 4 Scout 17B (16E)
109B MoEMeta Llama 4
Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。
55.0 GB
最低显存
10486K
上下文
28
tok/s
可用格式
Llama 4 Maverick 17B (128E)
400B MoEMeta Llama 4
Llama 4 Maverick 旗舰 MoE(激活 17B / 总 400B),需多卡或 H100 集群。
198.0 GB
最低显存
1049K
上下文
10
tok/s
可用格式
Llama 3.1 405B Instruct
405BMeta Llama 3.1
Meta 前沿稠密 405B,Q4 约需 230GB+ 显存;双 H100 80G 或 8 卡消费级方案。
192.0 GB
最低显存
131K
上下文
10
tok/s
可用格式
Qwen3 32B Instruct
32BAlibaba Qwen3
Qwen3 稠密 32B — Qwen2.5-32B 继任者,推理与思考模式全面升级。
16.8 GB
最低显存
41K
上下文
62
tok/s
可用格式
Qwen3 30B-A3B Instruct
30B-A3BAlibaba Qwen3
Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。
17.5 GB
最低显存
41K
上下文
118
tok/s
可用格式
Qwen3 235B-A22B Instruct
235B-A22BAlibaba Qwen3
Qwen3 旗舰 MoE(激活 22B / 总 235B)。Q4_K_M 约 142GB,对标 DeepSeek-R1 级模型。
115.0 GB
最低显存
41K
上下文
14
tok/s
可用格式
DeepSeek-V3
671B MoEDeepSeek
DeepSeek-V3 前沿 MoE(激活约 37B / 总 671B)。MLA + FP8;Q4 需多节点 GPU 集群。
310.0 GB
最低显存
164K
上下文
5
tok/s
可用格式
DeepSeek-R1
671B MoEDeepSeek
基于 V3 MoE 的 DeepSeek-R1 推理模型。前沿级思维链 — 本地 GPU 请用蒸馏版。
310.0 GB
最低显存
164K
上下文
5
tok/s
可用格式
Qwen3 4B Instruct
4BAlibaba Qwen3
最小 Qwen3 稠密模型,支持思考模式。Q4 约 3.2GB,适合 8GB 显卡与边缘设备。
2.8 GB
最低显存
33K
上下文
248
tok/s
可用格式
Qwen3-Coder 30B-A3B Instruct
30B-A3BAlibaba Qwen3
Agentic 代码 MoE,3.3B 激活参数,原生 256K 上下文。16–24GB 显卡上最强开源代码模型之一。
17.8 GB
最低显存
262K
上下文
115
tok/s
可用格式
Mistral Large 3 675B Instruct
675B MoEMistral AI
Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。
312.0 GB
最低显存
262K
上下文
5
tok/s
可用格式
GLM-4-9B-Chat
9BZhipu GLM-4
智谱 GLM-4 开源 9B,128K 上下文,支持工具调用,中英双语表现突出。
5.5 GB
最低显存
131K
上下文
178
tok/s
可用格式
Gemma 3 27B IT
27BGoogle Gemma 3
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
13.0 GB
最低显存
131K
上下文
62
tok/s
可用格式
DeepSeek-R1-Distill-Llama-8B
8BDeepSeek
R1 推理蒸馏到 Llama 3.1 8B。8–12GB 显卡上最佳思维链之一,社区 GGUF 极丰富。
4.9 GB
最低显存
131K
上下文
210
tok/s
可用格式
Phi-4 14B
14BMicrosoft Phi
微软 Phi-4 稠密 14B,同尺寸推理能力突出。Q4 约 9GB,12GB 卡中等上下文可跑。
8.2 GB
最低显存
16K
上下文
112
tok/s
可用格式
Qwen3 1.7B Instruct
1.7BAlibaba Qwen3
迷你 Qwen3,支持思考模式。Q4 约 1.4GB,适合手机旁路、NUC 与常驻本地 Agent。
1.2 GB
最低显存
33K
上下文
320
tok/s
可用格式
GPT-OSS 20B
21B MoEOpenAI GPT-OSS
OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。
11.9 GB
最低显存
131K
上下文
205
tok/s
可用格式
GPT-OSS 120B
117B MoEOpenAI GPT-OSS
GPT-OSS 大杯(总 117B / 激活 5.1B)。原生 MXFP4 权重约 61GB —— 单张 80GB 卡或 128GB 统一内存 Mac 可跑。24GB 消费卡部分卸载虽慢但可用。
58.5 GB
最低显存
131K
上下文
24
tok/s
可用格式
GLM-4.5-Air
106B MoEZhipu GLM-4.5
智谱 Agent/推理向 MoE(总 106B / 激活 12B)。Q4 约 64GB —— 96GB+ 统一内存 Mac 或双 48GB 卡最合适。同级别中工具调用能力突出。
34.8 GB
最低显存
131K
上下文
26
tok/s
可用格式
Devstral Small 1.1 24B
24BMistral Devstral
Mistral 与 All Hands 合作的 Agent 编码模型,基于 Mistral Small 3.1。面向仓库级工具调用而非单文件补全。Q4 约 14GB,16GB 显卡可跑。
13.0 GB
最低显存
131K
上下文
88
tok/s
可用格式
Qwen3-VL 8B Instruct
8BAlibaba Qwen3-VL
当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。
5.3 GB
最低显存
41K
上下文
165
tok/s
可用格式
Qwen3-VL 30B-A3B Instruct
30B-A3BAlibaba Qwen3-VL
多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。
15.2 GB
最低显存
41K
上下文
112
tok/s
可用格式
Magistral Small 1.2 24B
24BMistral Magistral
Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。
13.0 GB
最低显存
131K
上下文
86
tok/s
可用格式
Seed-OSS 36B Instruct
36BByteDance Seed
稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。
17.4 GB
最低显存
524K
上下文
55
tok/s
可用格式