GLM-4-9B-Chat
9BZhipu GLM-4
智谱 GLM-4 开源 9B,128K 上下文,支持工具调用,中英双语表现突出。
消费级显卡Mac / 苹果芯片
131K
最大上下文
3
量化变体
GGUF Q8_0
最佳质量
99.6%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Qwen2.5 14B 对比14B
Qwen2.5 14B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
9.2 GB最低显存·98.6%精度
性能与资源消耗的最佳平衡点,Q4 量化仅需 16GB 显存。
14B
Phi-3 Medium 14B Instruct
Microsoft Phi
消费级显卡Mac / 苹果芯片
8.8 GB最低显存·99.2%精度
Microsoft 中型 Phi-3,16GB 显卡上质量/显存比极佳。
16B
DeepSeek-V2-Lite Chat
DeepSeek
消费级显卡Mac / 苹果芯片
9.6 GB最低显存·97.0%精度
MoE 通用模型(激活约 2.4B),长上下文,多语言对话能力强。
10B
Falcon 3 10B Instruct
TII UAE
消费级显卡Mac / 苹果芯片
6.2 GB最低显存·96.9%精度
TII 最新 Falcon,多语言与代码能力均衡。