Gemma 2 9B Instruct
9BGoogle Gemma 2
Google Gemma 2 采用滑动窗口注意力机制,性能超越同级 9B 模型。
消费级显卡Mac / 苹果芯片
8K
最大上下文
3
量化变体
GGUF Q8_0
最佳质量
99.8%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Gemma 2 对比2B
Gemma 2 2B Instruct
Google Gemma 2
消费级显卡Mac / 苹果芯片
1.8 GB最低显存·99.7%精度
超紧凑 Gemma 2,4GB 显存即可运行,适合边缘原型开发。
27B
Gemma 2 27B Instruct
Google Gemma 2
消费级显卡专业 GPU
16.2 GB最低显存·98.7%精度
最大开源 Gemma 2,推理能力强,Q4 量化需 24GB+ 显存。
14B
Qwen2.5 14B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
9.2 GB最低显存·98.6%精度
性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。
12B
Mistral Nemo 12B Instruct
Mistral AI
消费级显卡Mac / 苹果芯片
7.8 GB最低显存·99.1%精度
Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。