Seed-OSS 36B Instruct
36BByteDance Seed
稠密 36B,原生 512K 上下文。Q4 权重约 22GB,单张 24GB 卡或 2×16GB 拆分即可 —— 但真正的开销是上下文:512K 的 KV cache 单独就约 128GB,所以要先规划上下文再考虑权重。
消费级显卡专业 GPUMac / 苹果芯片
524K
最大上下文
4
量化变体
GGUF Q5_K_M
最佳质量
98.7%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Qwen2.5 32B 对比32B
Qwen2.5 32B Instruct
Alibaba Qwen2.5
消费级显卡专业 GPU
16.4 GB最低显存·97.3%精度
24GB 显存单卡可运行 Q4_K_S,推理能力接近 GPT-4,性价比极高。
32B
DeepSeek-R1-Distill-Qwen-32B
DeepSeek
消费级显卡专业 GPU
16.8 GB最低显存·97.4%精度
R1 蒸馏至 32B,单卡 24GB(Q3/Q4)即可接近前沿推理能力。
32B
Qwen3 32B Instruct
Alibaba Qwen3
消费级显卡专业 GPU
16.8 GB最低显存·97.5%精度
Qwen3 稠密 32B — Qwen2.5-32B 继任者,推理与思考模式全面升级。
30B-A3B
Qwen3 30B-A3B Instruct
Alibaba Qwen3
消费级显卡Mac / 苹果芯片
17.5 GB最低显存·98.9%精度
Qwen3 MoE,仅 3B 激活参数。Q4 约 19GB,16GB 显卡上超越 QwQ-32B。