Mac M1 8G 能跑哪些大模型?
在 8GB、4K 上下文下,索引中 87 个模型有 20 个可从容运行,各自取仍留有余量的最高质量档位。
Mac M1 8G 的简短答案
8 GB,68 GB/s(由苹果的两处表述推算:M2(100 GB/s)比它快 50%,M1 Max(400 GB/s)是它的近 6 倍;苹果没有直接列出 M1 的数字。)。索引中 87 个模型里有 20 个能在 4K 上下文下从容运行,31 个至少能加载。
- 能装下的最大模型
- Llama 3.1 8B Instruct — Q2_K 下约 3.3 GB —— 4K 时仅剩 2.7 GB,上下文再拉长就要动用这点余量。
- 速度上限
- Llama 3.1 8B Instruct 在 Q4_K_M 下每个 token 要读取 4.6 GB 权重,因此 68 GB/s 给出的硬上限约为 15 tok/s。这是两个公开数字的算术结果,不是跑分 —— 实际吞吐会低于它。 本站没有在这张卡上的实测记录,因此无法与这个上限对照。
- 你会先撞到的墙
- 瓶颈是 GPU 能用到的那部分统一内存,而不是标称的 8 GB。macOS 会为系统保留一部分,并限制单个进程可以锁定的内存量,因此实际预算明显低于标称值 —— 这个上限可以调整(`iogpu.wired_limit_mb`),但它确实存在。带宽为 68 GB/s,模型装下之后,决定 tok/s 的就是这个数字。
7B · 10
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Llama 3.1 8B Instruct8B | Q2_K | 3.31 GB | +2.7 GB | 210 |
| Qwen2.5 7B Instruct7B | Q4_K_M | 5.07 GB | +0.9 GB | 155 |
| Qwen2.5-Coder 7B Instruct7B | Q4_K_M | 5.07 GB | +0.9 GB | 158估算 |
| DeepSeek-R1-Distill-Qwen-7B7B | Q4_K_M | 5.07 GB | +0.9 GB | 152估算 |
| Gemma 4 E4B ITE4B | Q4_K_M | 4.88 GB | +1.1 GB | — |
| WizardLM-2 7B7B | Q4_K_M | 5.14 GB | +0.9 GB | 152估算 |
| Mistral 7B Instruct v0.37B | Q4_K_M | 5.14 GB | +0.9 GB | 158估算 |
| Zephyr 7B Beta7B | Q4_K_M | 5.14 GB | +0.9 GB | 155估算 |
| Gemma 4 E2B ITE2B | Q8_0 | 5.2 GB | +0.8 GB | — |
| Gemma 3 4B IT4B | Q8_0 | 5.05 GB | +1 GB | 145估算 |
≤3B · 10
| 模型 | 量化档位 | 预估显存 | 余量 | RTX 4090 上的 tok/s |
|---|---|---|---|---|
| Qwen3 4B Instruct4B | Q6_K | 4.05 GB | +2 GB | 145 |
| Phi-4 Mini Instruct3.8B | Q8_0 | 4.81 GB | +1.2 GB | 262估算 |
| Phi-3.5 Mini Instruct3.8B | Q4_K_M | 4.07 GB | +1.9 GB | 298估算 |
| Llama 3.2 3B Instruct3B | Q8_0 | 4.05 GB | +2 GB | 285估算 |
| Qwen2.5 3B Instruct3B | Q8_0 | 3.59 GB | +2.4 GB | 290估算 |
| Gemma 2 2B Instruct2B | Q8_0 | 3.34 GB | +2.7 GB | 320估算 |
| Qwen3 1.7B Instruct1.7B | Q8_0 | 2.39 GB | +3.6 GB | 240估算 |
| Qwen2.5 1.5B Instruct1.5B | Q8_0 | 1.83 GB | +4.2 GB | 410估算 |
| Llama 3.2 1B Instruct1B | Q8_0 | 1.51 GB | +4.5 GB | 450估算 |
| Qwen2.5 0.5B Instruct0.5B | Q8_0 | 0.6 GB | +5.4 GB | 540估算 |
这个列表是怎么算出来的
每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。
另有 11 个模型能加载但不留余量(占用至多为显存的 105%)—— 模型库的显卡快捷筛选把它们也计入,因此那里的数字更大。
在这张卡上的实测数据
本索引中没有在 Mac M1 8G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。 上面表格里的速度一列是 RTX 4090 上的数字,仅作参考,不是这张卡的速度。
显存预算相同的显卡
能装下什么由显存决定,所以同类型的每张 8GB 显卡返回的列表都一样。这几个页面给出的不是不同答案 —— 它们的差别在吞吐,而本索引并未逐卡实测吞吐。
再往上一档
Mac M3 16G(16GB)比这张卡多装下 27 个索引内的模型。 Mac M3 16G →
常见问题
Mac M1 8G 上最适合本地运行的大模型是哪个?
日常使用推荐 Llama 3.1 8B Instruct(Q2_K)—— 在 4K 上下文下约占这张卡 8 GB 中的 3.3 GB,还剩 2.7 GB 给更长的窗口。如果你要的是能加载的最大模型,那是 Llama 3.1 8B Instruct(Q2_K,约 3.3 GB,余量 2.7 GB)。这里的「最适合」指的是最契合显存预算 —— 本索引不跑任务基准,无法告诉你哪个模型更聪明。
Mac M1 8G 能跑 Qwen3 8B Instruct 吗?
勉强。它在本索引中最小的构建 Q4_K_M 约需 5.8 GB,而这张卡可用约 6.0 GB —— 在没有其他程序占用时能加载,但没有任何余量留给更长的上下文。上面的清单里没有它,因为那份清单要求模型占用不超过可用显存的 88%。
Mac M1 8G 跑 8B 模型的 Q4 量化大概有多少 tok/s?
本索引没有这张卡的实测记录,因此不公布具体数字。可以从规格推出的是:生成一个 token 需要把每个权重都读一遍,Llama 3.1 8B Instruct 在 Q4_K_M 下权重为 4.6 GB,而这张卡的带宽是 68 GB/s —— 上限约 15 tok/s。批大小、上下文长度、运行时以及缓存命中情况都会把实际值压到这个数以下。
本地跑大模型,Mac M1 8G 还是 RTX 3070 Ti?
两张卡装得下的模型相同:8 GB 与 8 GB 在 4K 下分别可从容运行 87 个中的 20 个与 36 个。差别在吞吐 —— 68 GB/s 对 608 GB/s,读取权重的速度相差 8.9 倍,而 token 生成正是受此限制。两张卡都装得下的模型,RTX 3070 Ti 生成更快。
在 8GB、4K 上下文下,索引中 87 个模型有 20 个可从容运行,各自取仍留有余量的最高质量档位。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-02 RSS → /zh/feed.xml