GPT-OSS 120B
117B MoEOpenAI GPT-OSS
GPT-OSS 大杯(总 117B / 激活 5.1B)。原生 MXFP4 权重约 61GB —— 单张 80GB 卡或 128GB 统一内存 Mac 可跑。24GB 消费卡部分卸载虽慢但可用。
专业 GPUMac / 苹果芯片
131K
最大上下文
2
量化变体
GGUF MXFP4
最佳质量
100.0%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 GPT-OSS 20B 对比21B MoE
GPT-OSS 20B
OpenAI GPT-OSS
消费级显卡Mac / 苹果芯片
11.9 GB最低显存·100.0%精度
OpenAI 开放权重 MoE(总 21B / 激活 3.6B),原生以 MXFP4 发布 —— 约 12.8GB,16GB 显卡即可跑且无额外精度损失。激活仅 3.6B,CPU 卸载也还能用。
106B MoE
GLM-4.5-Air
Zhipu GLM-4.5
专业 GPUMac / 苹果芯片
34.8 GB最低显存·97.6%精度
智谱 Agent/推理向 MoE(总 106B / 激活 12B)。Q4 约 64GB —— 96GB+ 统一内存 Mac 或双 48GB 卡最合适。同级别中工具调用能力突出。
132B
DBRX Instruct
Databricks
专业 GPU
63.2 GB最低显存·97.5%精度
MoE 旗舰(激活约 36B),需多卡;大规模代码与推理能力强。
235B-A22B
Qwen3 235B-A22B Instruct
Alibaba Qwen3
专业 GPU
115.0 GB最低显存·97.8%精度
Qwen3 旗舰 MoE(激活 22B / 总 235B)。Q4_K_M 约 142GB,对标 DeepSeek-R1 级模型。