Llama 3.2 1B Instruct
1BMeta Llama 3.2
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
131K
最大上下文
2
量化变体
GGUF Q8_0
最佳质量
99.5%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Llama 3.2 对比3B
Llama 3.2 3B Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
2.0 GB最低显存·99.8%精度
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
11B
Llama 3.2 11B Vision Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
9.5 GB最低显存·99.5%精度
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
3B
Qwen2.5 3B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
2.1 GB最低显存·99.7%精度
Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。
2B
Gemma 2 2B Instruct
Google Gemma 2
消费级显卡Mac / 苹果芯片
1.8 GB最低显存·99.7%精度
超紧凑 Gemma 2,4GB 显存即可运行,适合边缘原型开发。