DeepSeek-R1-Distill-Llama-70B
70BDeepSeek
R1 推理能力注入 Llama 70B 架构,双卡部署的顶级开源推理模型。
专业 GPU
131K
最大上下文
2
量化变体
GGUF Q4_K_M
最佳质量
97.6%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 DeepSeek-V3 对比671B MoE
DeepSeek-V3
DeepSeek
专业 GPU
310.0 GB最低显存·98.0%精度
DeepSeek-V3 前沿 MoE(激活约 37B / 总 671B)。MLA + FP8;Q4 需多节点 GPU 集群。
671B MoE
DeepSeek-R1
DeepSeek
专业 GPU
310.0 GB最低显存·98.2%精度
基于 V3 MoE 的 DeepSeek-R1 推理模型。前沿级思维链 — 本地 GPU 请用蒸馏版。
32B
DeepSeek-R1-Distill-Qwen-32B
DeepSeek
消费级显卡专业 GPU
16.8 GB最低显存·97.4%精度
R1 蒸馏至 32B,单卡 24GB(Q3/Q4)即可接近前沿推理能力。
14B
DeepSeek-R1-Distill-Qwen-14B
DeepSeek
消费级显卡
9.2 GB最低显存·98.0%精度
R1 推理能力蒸馏至 14B,社区热度极高,思维链能力出色。