Devstral Small 1.1 24B
24BMistral Devstral
Mistral 与 All Hands 合作的 Agent 编码模型,基于 Mistral Small 3.1。面向仓库级工具调用而非单文件补全。Q4 约 14GB,16GB 显卡可跑。
消费级显卡Mac / 苹果芯片
131K
最大上下文
5
量化变体
GGUF Q6_K
最佳质量
99.4%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
30B-A3B
Qwen3 30B-A3B Instruct
Alibaba Qwen3
消费级显卡Mac / 苹果芯片
17.5 GB最低显存·98.9%精度
Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。
30B-A3B
Qwen3-Coder 30B-A3B Instruct
Alibaba Qwen3
消费级显卡Mac / 苹果芯片
17.8 GB最低显存·99.0%精度
Agentic 代码 MoE,3.3B 激活参数,原生 256K 上下文。16–24GB 显卡上最强开源代码模型之一。
21B MoE
GPT-OSS 20B
OpenAI GPT-OSS
消费级显卡Mac / 苹果芯片
11.9 GB最低显存·100.0%精度
OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。
36B
Seed-OSS 36B Instruct
ByteDance Seed
消费级显卡专业 GPU
17.4 GB最低显存·98.7%精度
稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。