Qwen3-VL 30B-A3B Instruct
30B-A3BAlibaba Qwen3-VL
多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。
消费级显卡专业 GPUMac / 苹果芯片
41K
最大上下文
4
量化变体
GGUF Q8_0
最佳质量
99.7%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Qwen3-VL 8B 对比8B
Qwen3-VL 8B Instruct
Alibaba Qwen3-VL
消费级显卡Mac / 苹果芯片
5.3 GB最低显存·99.7%精度
当代视觉语言模型,Q4 约 5.9GB,单张 8–12GB 卡仍可跑。没有 24GB 显卡的人做多模态的现实选择 —— 注意视觉编码器会额外占用显存,下方 KV cache 计算并未包含这部分。
27B
Gemma 3 27B IT
Google Gemma 3
消费级显卡专业 GPU
13.0 GB最低显存·97.2%精度
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
24B
Magistral Small 1.2 24B
Mistral Magistral
消费级显卡Mac / 苹果芯片
13.0 GB最低显存·99.4%精度
Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。
36B
Seed-OSS 36B Instruct
ByteDance Seed
消费级显卡专业 GPU
17.4 GB最低显存·98.7%精度
稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。