Qwen3-VL 8B Instruct
8BAlibaba Qwen3-VL
当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
41K
最大上下文
4
量化变体
GGUF Q8_0
最佳质量
99.7%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
30B-A3B
Qwen3-VL 30B-A3B Instruct
Alibaba Qwen3-VL
消费级显卡专业 GPU
15.2 GB最低显存·99.7%精度
多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。
12B
Gemma 3 12B IT
Google Gemma 3
消费级显卡Mac / 苹果芯片
8.0 GB最低显存·98.7%精度
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
14B
Qwen2.5 14B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
9.2 GB最低显存·98.6%精度
性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。
12B
Mistral Nemo 12B Instruct
Mistral AI
消费级显卡Mac / 苹果芯片
7.8 GB最低显存·99.1%精度
Mistral 与 NVIDIA 合作推出,128K 上下文,多语言能力出色。