Mistral Nemo 12B Instruct
12BMistral AI
Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。
131K
最大上下文
3
量化变体
GGUF Q6_K
最佳质量
99.1%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站跑过 · 估算 = 本站未跑过:推算所得,或本站未核实的数字 · 社区 = 公开报告
相似模型
与 Mistral 7B 对比Mistral 7B Instruct v0.3
Mistral AI
经典 Mistral 7B v0.3,仍是本地对话 API 的可靠基线。
Mistral Small 24B Instruct
Mistral AI
Mistral 高效 24B 模型,多语言能力强,Q4 量化可装入 24GB 显存。
Mixtral 8x7B Instruct
Mistral AI
经典 MoE 模型,每 token 约 13B 激活参数,Q4 量化需 32GB+ 显存。
Mistral Large 3 675B Instruct
Mistral AI
Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。注意力为 DeepSeek 式 MLA,实际 KV 缓存比下方按常规结构(未核实)估算的数字小。32K 下相对约 390 GB 权重可忽略;用满 256K 时,请把缓存数字当作上限。
在本地运行 Mistral Nemo 12B Instruct
在 Q4_K_M、4K 上下文下,Mistral Nemo 12B Instruct 约需 8.4 GB —— 权重 7.0 GB、KV 缓存 0.63 GB、激活缓冲 0.8 GB。本索引中能宽裕跑它的最小规格是 10 GB 显卡 —— 共 2 张,Arc B570 10G 起步;76 张卡中有 65 张可以。这些是计算值而非实测值:估算把「宽裕」的界线画在显存的 88%,大致就是桌面环境需要留出的余量。
上下文变长会多花多少
从 4K 提到 32K 约多占 4.37 GB,总量来到 13.2 GB。权重不随上下文变化,只有 KV 缓存会,而且是线性增长 —— 规划长文档场景时要盯的就是这个数字。该模型的原生上下文是 128K;在 Q4_K_M 下把它全部撑满约需 30 GB。
该下载哪个版本
本索引收录了它的 2 种格式 —— GGUF、AWQ —— 共 3 个档位。 其中 Q6_K 的公开困惑度损失最低,为 0.9%。列出的最快档位是 AWQ INT4,在 RTX 4090、batch 1 下约 148 tok/s —— 这是估算值,不是本站硬件上的实测。GGUF 可在 NVIDIA、AMD 与苹果芯片上通过 llama.cpp 和 Ollama 运行;AWQ 与 GPTQ 面向 CUDA 和 ROCm 上的 vLLM;EXL2 是 ExLlamaV2 —— 仅限 CUDA,而且已经归档,适合本机使用而不适合提供服务。
常见问题
- Mistral Nemo 12B Instruct 需要多少显存?
- 在 Q4_K_M、4K 上下文、batch 1 下约 8.4 GB,到 32K 时约 13.2 GB。这个数字是权重加 KV 缓存再加 10% 激活缓冲,由模型架构计算得出,不是在显卡上实测的。
- Mistral Nemo 12B Instruct 能在 10GB 显卡上跑吗?
- 可以 —— 在 Q4_K_M、4K 上下文下约需 8.4 GB,在 Arc B570 10G 上还剩 1.6 GB,本索引中 2 张 10 GB 显卡都一样。这是能宽裕跑它的最小规格;76 张中有 65 张可以。
- Mistral Nemo 12B Instruct 该用哪个量化档位?
- Q6_K 的公开质量损失最低(0.9%),而 Q4_K_M 是多数人实际使用的档位。索引中的 3 个档位是 Q4_K_M、Q6_K、AWQ INT4。
这个模型能跑在哪
按 Q4_K_M、4K 上下文估算,显存从小到大排列。「从容」指估算占用不超过显存的 88%。
怎么把它跑起来
针对本模型及同类硬件的部署指南。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-06 RSS → /zh/feed.xml