Llama 4 Scout 17B (16E)
109B MoEMeta Llama 4
Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。
专业 GPU
10486K
最大上下文
3
量化变体
GGUF Q4_K_M
最佳质量
97.6%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Llama 4 对比400B MoE
Llama 4 Maverick 17B (128E)
Meta Llama 4
专业 GPU
198.0 GB最低显存·97.8%精度
Llama 4 Maverick 旗舰 MoE(激活 17B / 总 400B),需多卡或 H100 集群。
675B MoE
Mistral Large 3 675B Instruct
Mistral AI
专业 GPU
312.0 GB最低显存·97.9%精度
Mistral 3 旗舰 MoE(激活 41B / 总 675B),含视觉编码器。FP8 需 8×H200;GGUF 量化仅供研究集群。
70B
Llama 3.1 70B Instruct
Meta Llama 3.1
专业 GPUMac / 苹果芯片
33.4 GB最低显存·98.8%精度
Meta 前沿 70B 模型,需要 40GB+ 显存,适合双 3090 或 M2 Ultra。
72B
Qwen2.5 72B Instruct
Alibaba Qwen2.5
专业 GPU
33.8 GB最低显存·98.9%精度
Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。