Gemma 3 4B IT
4BGoogle Gemma 3
Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
131K
最大上下文
3
量化变体
GGUF Q8_0
最佳质量
99.8%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Gemma 3 对比12B
Gemma 3 12B IT
Google Gemma 3
消费级显卡Mac / 苹果芯片
8.0 GB最低显存·98.7%精度
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
27B
Gemma 3 27B IT
Google Gemma 3
消费级显卡专业 GPU
13.0 GB最低显存·97.2%精度
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
8B
Llama 3.1 8B Instruct
Meta Llama 3.1
消费级显卡Mac / 苹果芯片
3.2 GB最低显存·99.9%精度
Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。
7B
Qwen2.5 7B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
4.8 GB最低显存·99.3%精度
阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。