InternLM2 7B Chat
7BShanghai AI Lab
⚠ 已过时 · 建议改用 Qwen3 8B Instruct
本索引现在会建议改用 Qwen3 8B Instruct——上下文更长(32K → 40K)。下面的数字依然准确,只是这已经不是一个值得从它开始的型号了。 对比两者 →
上海 AI Lab 强力中英双语 7B,性能与 Qwen 7B 相当。
33K
最大上下文
2
量化变体
GGUF Q4_K_M
最佳质量
96.9%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站跑过 · 估算 = 本站未跑过:推算所得,或本站未核实的数字 · 社区 = 公开报告
InternLM2 20B Chat
Shanghai AI Lab
中型 InternLM2,中文理解出色,Q4 量化可装入 24GB 显存。
Llama 3.1 8B Instruct
Meta Llama 3.1
Meta 旗舰 8B 模型,128K 上下文,端侧部署最优选择之一。
Qwen2.5 7B Instruct
Alibaba Qwen2.5
阿里 Qwen 系列 7B,性能远超同级,代码能力尤其突出。
Phi-3.5 Mini Instruct
Microsoft Phi
Microsoft 的小巧精悍之作,端侧部署最佳 4B 模型之一。
在本地运行 InternLM2 7B Chat
在 Q4_K_M、4K 上下文下,InternLM2 7B Chat 约需 5.5 GB —— 权重 4.5 GB、KV 缓存 0.50 GB、激活缓冲 0.5 GB。本索引中能宽裕跑它的最小规格是 8 GB 显卡 —— 共 9 张,RTX 4060 起步;76 张卡中有 74 张可以。这些是计算值而非实测值:估算把「宽裕」的界线画在显存的 88%,大致就是桌面环境需要留出的余量。
上下文变长会多花多少
从 4K 提到 32K 约多占 3.50 GB,总量来到 9.3 GB。权重不随上下文变化,只有 KV 缓存会,而且是线性增长 —— 规划长文档场景时要盯的就是这个数字。该模型的原生上下文是 32K;在 Q4_K_M 下把它全部撑满约需 9 GB。
该下载哪个版本
本索引收录了它的 2 种格式 —— GGUF、AWQ —— 共 2 个档位。 其中 Q4_K_M 的公开困惑度损失最低,为 3.1%。列出的最快档位是 AWQ INT4,在 RTX 4090、batch 1 下约 215 tok/s —— 这是估算值,不是本站硬件上的实测。GGUF 可在 NVIDIA、AMD 与苹果芯片上通过 llama.cpp 和 Ollama 运行;AWQ 与 GPTQ 面向 CUDA 和 ROCm 上的 vLLM;EXL2 是 ExLlamaV2 —— 仅限 CUDA,而且已经归档,适合本机使用而不适合提供服务。
常见问题
- InternLM2 7B Chat 需要多少显存?
- 在 Q4_K_M、4K 上下文、batch 1 下约 5.5 GB,到 32K 时约 9.3 GB。这个数字是权重加 KV 缓存再加 10% 激活缓冲,由模型架构计算得出,不是在显卡上实测的。
- InternLM2 7B Chat 能在 8GB 显卡上跑吗?
- 可以 —— 在 Q4_K_M、4K 上下文下约需 5.5 GB,在 RTX 4060 上还剩 2.5 GB,本索引中 9 张 8 GB 显卡都一样。这是能宽裕跑它的最小规格;76 张中有 74 张可以。
- InternLM2 7B Chat 该用哪个量化档位?
- Q4_K_M 的公开质量损失最低(3.1%),而 Q4_K_M 是多数人实际使用的档位。索引中的 2 个档位是 Q4_K_M、AWQ INT4。
这个模型能跑在哪
按 Q4_K_M、4K 上下文估算,显存从小到大排列。「从容」指估算占用不超过显存的 88%。
怎么把它跑起来
针对本模型及同类硬件的部署指南。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-06 RSS → /zh/feed.xml