Gemma 2 2B Instruct
2BGoogle Gemma 2
超紧凑 Gemma 2,4GB 显存即可运行,适合边缘原型开发。
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
8K
最大上下文
3
量化变体
GGUF Q8_0
最佳质量
99.7%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Gemma 2 对比9B
Gemma 2 9B Instruct
Google Gemma 2
消费级显卡Mac / 苹果芯片
5.8 GB最低显存·99.8%精度
Google Gemma 2 采用滑动窗口注意力机制,性能超越同级 9B 模型。
27B
Gemma 2 27B Instruct
Google Gemma 2
消费级显卡专业 GPU
16.2 GB最低显存·98.7%精度
最大开源 Gemma 2,推理能力强,Q4 量化需 24GB+ 显存。
3B
Llama 3.2 3B Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
2.0 GB最低显存·99.8%精度
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
3B
Qwen2.5 3B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
2.1 GB最低显存·99.7%精度
Qwen2.5 迷你版,适合边缘设备,4GB 显存或树莓派级别硬件即可运行。