Gemma 3 27B IT
27BGoogle Gemma 3
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
消费级显卡专业 GPU
131K
最大上下文
3
量化变体
GGUF Q4_K_M
最佳质量
97.2%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Gemma 3 对比4B
Gemma 3 4B IT
Google Gemma 3
消费级显卡Mac / 苹果芯片
3.0 GB最低显存·99.8%精度
Google Gemma 3 多模态 4B,128K 上下文,8GB 显卡可跑图文理解。
12B
Gemma 3 12B IT
Google Gemma 3
消费级显卡Mac / 苹果芯片
8.0 GB最低显存·98.7%精度
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
30B-A3B
Qwen3-VL 30B-A3B Instruct
Alibaba Qwen3-VL
消费级显卡专业 GPU
15.2 GB最低显存·99.7%精度
多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。
24B
Magistral Small 1.2 24B
Mistral Magistral
消费级显卡Mac / 苹果芯片
13.0 GB最低显存·99.4%精度
Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。