Llama 3.3 70B Instruct
70BMeta Llama 3.3
Meta 最新 70B,多语言能力提升,可无缝替换 Llama 3.1 70B。
专业 GPUMac / 苹果芯片
131K
最大上下文
3
量化变体
GGUF Q5_K_M
最佳质量
99.0%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Llama 3.1 对比70B
Llama 3.1 70B Instruct
Meta Llama 3.1
专业 GPUMac / 苹果芯片
33.4 GB最低显存·98.8%精度
Meta 前沿 70B 模型,需要 40GB+ 显存,适合双 3090 或 M2 Ultra。
117B MoE
GPT-OSS 120B
OpenAI GPT-OSS
专业 GPUMac / 苹果芯片
58.5 GB最低显存·100.0%精度
GPT-OSS 大杯(总 117B / 激活 5.1B)。原生 MXFP4 权重约 61GB —— 单张 80GB 卡或 128GB 统一内存 Mac 可跑。24GB 消费卡部分卸载虽慢但可用。
106B MoE
GLM-4.5-Air
Zhipu GLM-4.5
专业 GPUMac / 苹果芯片
34.8 GB最低显存·97.6%精度
智谱 Agent/推理向 MoE(总 106B / 激活 12B)。Q4 约 64GB —— 96GB+ 统一内存 Mac 或双 48GB 卡最合适。同级别中工具调用能力突出。
72B
Qwen2.5 72B Instruct
Alibaba Qwen2.5
专业 GPU
33.8 GB最低显存·98.9%精度
Qwen2.5 旗舰模型,需双 4090 或 A100 80G,大规模推理能力卓越。