OpenChat 3.6 8B
8BOpenChat
已过时 · 建议改用 Qwen3 8B Instruct
C-RLFT 微调的 Llama 3.1 8B,对话语气自然流畅。
消费级显卡Mac / 苹果芯片CPU / 轻量VPS
8K
最大上下文
2
量化变体
EXL2 4.65bpw
最佳质量
97.6%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Llama 3.1 对比8B
Llama 3.1 8B Instruct
Meta Llama 3.1
消费级显卡Mac / 苹果芯片
3.2 GB最低显存·99.9%精度
Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。
7B
Qwen2.5 7B Instruct
Alibaba Qwen2.5
消费级显卡Mac / 苹果芯片
4.8 GB最低显存·99.3%精度
阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。
3.8B
Phi-3.5 Mini Instruct
Microsoft Phi
消费级显卡Mac / 苹果芯片
2.5 GB最低显存·99.8%精度
Microsoft 的小巧精悍之作,端侧部署最佳 4B 模型之一。
8B
Nous Hermes 3 Llama 3.1 8B
NousResearch
消费级显卡Mac / 苹果芯片
5.4 GB最低显存·97.7%精度
基于 Llama 3.1 8B 微调,角色扮演和指令遵循能力增强。