SmolLM3 3B
3BHugging Face SmolLM
Hugging Face 完全开源的 3B 模型,训练数据和训练方法随权重一起公开。它带一个可开关的推理模式,实际训练到的上下文窗口是 64K,128K 要靠 YaRN 外推。只有 4 个 KV 头,缓存很小,所以长窗口也负担得起:Q4_K_M 下短上下文能放进 4 GB 显卡,用满训练窗口也能放进 8 GB 显卡。这也让它成为本站少数在纯 CPU 机器上也现实可用的模型之一。下方体积使用计算器的通用比特率,因为未能核对到 GGUF 文件大小,各档位的质量损失也未公布。
66K
最大上下文
2
量化变体
GGUF Q8_0
最佳质量
—
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站跑过 · 估算 = 本站未跑过:推算所得,或本站未核实的数字 · 社区 = 公开报告
相似模型
与 Llama 3.2 对比Llama 3.2 3B Instruct
Meta Llama 3.2
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
Qwen2.5 3B Instruct
Alibaba Qwen2.5
Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。
Llama 3.2 1B Instruct
Meta Llama 3.2
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
Gemma 2 2B Instruct
Google Gemma 2
超紧凑 Gemma 2,4GB 显存即可运行,适合边缘原型开发。
在本地运行 SmolLM3 3B
在 Q4_K_M、4K 上下文下,SmolLM3 3B 约需 2.3 GB —— 权重 1.8 GB、KV 缓存 0.28 GB、激活缓冲 0.2 GB。本索引中能宽裕跑它的最小规格是 8 GB 显卡 —— 共 10 张,Mac M1 8G 起步;70 张卡中有 70 张可以。这些是计算值而非实测值:估算把「宽裕」的界线画在显存的 88%,大致就是桌面环境需要留出的余量。
上下文变长会多花多少
从 4K 提到 32K 约多占 1.97 GB,总量来到 4.4 GB。权重不随上下文变化,只有 KV 缓存会,而且是线性增长 —— 规划长文档场景时要盯的就是这个数字。该模型的原生上下文是 64K;在 Q4_K_M 下把它全部撑满约需 7 GB。
该下载哪个版本
本索引只收录了 SmolLM3 3B 的 GGUF 格式,共 2 个档位(Q4_K_M、Q8_0)。 该模型没有公开的逐档困惑度数据,因此质量一列留空而不是填估算值 —— 在同一个模型内部,位数越多越忠实是数据唯一支持的排序。本站硬件上没有该模型的吞吐实测数据。GGUF 可在 NVIDIA、AMD 与苹果芯片上通过 llama.cpp 和 Ollama 运行;AWQ 与 GPTQ 面向 CUDA 和 ROCm 上的 vLLM;EXL2 是 ExLlamaV2 —— 仅限 CUDA,而且已经归档,适合本机使用而不适合提供服务。
常见问题
- SmolLM3 3B 需要多少显存?
- 在 Q4_K_M、4K 上下文、batch 1 下约 2.3 GB,到 32K 时约 4.4 GB。这个数字是权重加 KV 缓存再加 10% 激活缓冲,由模型架构计算得出,不是在显卡上实测的。
- SmolLM3 3B 能在 8GB 显卡上跑吗?
- 可以 —— 在 Q4_K_M、4K 上下文下约需 2.3 GB,在 Mac M1 8G 上还剩 3.7 GB,本索引中 10 张 8 GB 显卡都一样。这是能宽裕跑它的最小规格;70 张中有 70 张可以。
- SmolLM3 3B 该用哪个量化档位?
- 该模型没有公开的质量对比数据,所以按体积来选:Q4_K_M 是多数人使用的档位,bits-per-weight 越高越忠实。索引中的 2 个档位是 Q4_K_M、Q8_0。
这个模型能跑在哪
按 Q4_K_M、4K 上下文估算,显存从小到大排列。「从容」指估算占用不超过显存的 88%。
怎么把它跑起来
针对本模型及同类硬件的部署指南。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-03 RSS → /zh/feed.xml