Magistral Small 1.2 24B
24BMistral Magistral
Mistral 基于 Mistral Small 3.2 的推理模型,思维链包在 [THINK] 标签内。Q4 约 14GB,让显式思维链落到 16GB 显卡上 —— 比多数教程默认的 70B 级推理模型低一档。
消费级显卡Mac / 苹果芯片
131K
最大上下文
5
量化变体
GGUF Q6_K
最佳质量
99.4%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
30B-A3B
Qwen3-VL 30B-A3B Instruct
Alibaba Qwen3-VL
消费级显卡专业 GPU
15.2 GB最低显存·99.7%精度
多模态 MoE,激活参数仅约 3B,因此在苹果统一内存上依然跟手,CPU 卸载的表现也远好于稠密 30B。Q4 约 19GB,24GB 显卡可完整放下。
27B
Gemma 3 27B IT
Google Gemma 3
消费级显卡专业 GPU
13.0 GB最低显存·97.2%精度
Gemma 3 大杯指令版,长上下文 + 多模态。Q4 约 16GB,适合 24GB 卡或双卡短上下文。
30B-A3B
Qwen3 30B-A3B Instruct
Alibaba Qwen3
消费级显卡Mac / 苹果芯片
17.5 GB最低显存·98.9%精度
Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。
21B MoE
GPT-OSS 20B
OpenAI GPT-OSS
消费级显卡Mac / 苹果芯片
11.9 GB最低显存·100.0%精度
OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。