Gemma 3 12B IT
12BGoogle Gemma 3
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
消费级显卡Mac / 苹果芯片
131K
最大上下文
3
量化变体
GGUF Q5_K_M
最佳质量
98.7%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Gemma 3 对比4B
Gemma 3 4B IT
Google Gemma 3
消费级显卡Mac / 苹果芯片
3.0 GB最低显存·99.8%精度
Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。
27B
Gemma 3 27B IT
Google Gemma 3
消费级显卡专业 GPU
13.0 GB最低显存·97.2%精度
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
8B
Qwen3-VL 8B Instruct
Alibaba Qwen3-VL
消费级显卡Mac / 苹果芯片
5.3 GB最低显存·99.7%精度
当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。
14B
Qwen2.5 14B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
9.2 GB最低显存·98.6%精度
性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。