DBRX Instruct
132BDatabricks
MoE 旗舰(激活约 36B),需多卡;大规模代码与推理能力强。
专业 GPU
33K
最大上下文
2
量化变体
GGUF Q4_K_M
最佳质量
97.5%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
235B-A22B
Qwen3 235B-A22B Instruct
Alibaba Qwen3
专业 GPU
115.0 GB最低显存·97.8%精度
Qwen3 旗舰 MoE(激活 22B / 总 235B)。Q4_K_M 约 142GB,对标 DeepSeek-R1 级模型。
671B MoE
DeepSeek-V3
DeepSeek
专业 GPU
310.0 GB最低显存·98.0%精度
DeepSeek-V3 前沿 MoE(激活约 37B / 总 671B)。MLA + FP8;Q4 需多节点 GPU 集群。
671B MoE
DeepSeek-R1
DeepSeek
专业 GPU
310.0 GB最低显存·98.2%精度
基于 V3 MoE 的 DeepSeek-R1 推理模型。前沿级思维链 — 本地 GPU 请用蒸馏版。
675B MoE
Mistral Large 3 675B Instruct
Mistral AI
专业 GPU
312.0 GB最低显存·97.9%精度
Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。