256GB 显存
Mac M5 Ultra 256G 能跑哪些大模型?
在 256GB、4K 上下文下,索引中 81 个模型有 78 个可从容运行,各自取仍留有余量的最高质量档位。
70B+ · 12
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| Llama 3.1 405B Instruct405B | AWQ INT4 | 213.77 GB | +42.2 GB | 10 |
| Llama 4 Maverick 17B (128E)400B MoE | Q3_K_M | 203.02 GB | +53 GB | 10 |
| Qwen3 235B-A22B Instruct235B-A22B | Q4_K_M | 149.68 GB | +106.3 GB | 10 |
| DBRX Instruct132B | Q4_K_M | 84.31 GB | +171.7 GB | 15 |
| GPT-OSS 120B117B MoE | MXFP4 | 65.15 GB | +190.9 GB | 22 |
| Llama 4 Scout 17B (16E)109B MoE | Q4_K_M | 69.88 GB | +186.1 GB | 22 |
| GLM-4.5-Air106B MoE | Q4_K_M | 67.94 GB | +188.1 GB | 18 |
| Llama 3.2 90B Vision Instruct90B | Q4_K_M | 57.5 GB | +198.5 GB | 22 |
| Qwen2.5 72B Instruct72B | Q5_K_M | 55.31 GB | +200.7 GB | 24 |
| Llama 3.1 70B Instruct70B | Q5_K_M | 53.75 GB | +202.3 GB | 32 |
| Llama 3.3 70B Instruct70B | Q5_K_M | 53.75 GB | +202.3 GB | 32 |
| DeepSeek-R1-Distill-Llama-70B70B | Q4_K_M | 46.1 GB | +209.9 GB | 36 |
32B · 19
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| Mixtral 8x7B Instruct47B MoE | Q4_K_M | 30.13 GB | +225.9 GB | 48 |
| Seed-OSS 36B Instruct36B | Q5_K_M | 27.81 GB | +228.2 GB | 37 |
| Command R 35B35B | Q4_K_M | 22.86 GB | +233.1 GB | 42 |
| Yi 1.5 34B Chat34B | Q4_K_M | 22.82 GB | +233.2 GB | 40 |
| Qwen3 32B Instruct32B | Q4_K_M | 21.85 GB | +234.2 GB | 42 |
| Qwen2.5 32B Instruct32B | Q4_K_M | 21.69 GB | +234.3 GB | 44 |
| Qwen2.5-Coder 32B Instruct32B | Q4_K_M | 21.69 GB | +234.3 GB | 44 |
| DeepSeek-R1-Distill-Qwen-32B32B | Q4_K_M | 21.69 GB | +234.3 GB | 42 |
| Qwen3 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +233 GB | 82 |
| Qwen3-Coder 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +233 GB | 80 |
| Qwen3-VL 30B-A3B Instruct30B-A3B | Q8_0 | 34.28 GB | +221.7 GB | 78 |
| Qwen3.8 27B27B | Q4_K_M | 17.47 GB | +238.5 GB | — |
| Gemma 3 27B IT27B | Q4_K_M | 19.49 GB | +236.5 GB | 48 |
| Gemma 2 27B Instruct27B | Q5_K_M | 21.76 GB | +234.2 GB | 42 |
| Mistral Small 24B Instruct24B | EXL2 4.65bpw | 15.26 GB | +240.7 GB | 88 |
| Devstral Small 1.1 24B24B | Q6_K | 20.91 GB | +235.1 GB | 48 |
| Magistral Small 1.2 24B24B | Q6_K | 20.91 GB | +235.1 GB | 47 |
| Codestral 22B22B | Q4_K_M | 15.03 GB | +241 GB | 58 |
| GPT-OSS 20B21B MoE | MXFP4 | 11.81 GB | +244.2 GB | 195 |
14B · 17
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| InternLM2 20B Chat20B | Q5_K_M | 15.59 GB | +240.4 GB | 68 |
| DeepSeek-Coder-V2-Lite Instruct16B | Q8_0 | 18.36 GB | +237.6 GB | 118 |
| DeepSeek-V2-Lite Chat16B | Q4_K_M | 10.87 GB | +245.1 GB | 142 |
| StarCoder2 15B15B | Q4_K_M | 10.19 GB | +245.8 GB | 92 |
| Qwen3 14B Instruct14B | Q5_K_M | 11.65 GB | +244.4 GB | 78 |
| Qwen2.5 14B Instruct14B | Q5_K_M | 11.73 GB | +244.3 GB | 86 |
| DeepSeek-R1-Distill-Qwen-14B14B | EXL2 4.65bpw | 9.75 GB | +246.3 GB | 128 |
| Phi-4 14B14B | Q5_K_M | 11.77 GB | +244.2 GB | 78 |
| Phi-3 Medium 14B Instruct14B | Q6_K | 12.86 GB | +243.1 GB | 88 |
| Mistral Nemo 12B Instruct12B | Q6_K | 11.14 GB | +244.9 GB | 95 |
| Gemma 3 12B IT12B | Q5_K_M | 10.6 GB | +245.4 GB | 92 |
| Stable LM 2 12B Chat12B | Q4_K_M | 8.35 GB | +247.7 GB | 108 |
| Jamba 1.5 Mini12B | Q4_K_M | 8.15 GB | +247.9 GB | 95 |
| Llama 3.2 11B Vision Instruct11B | Q8_0 | 12.9 GB | +243.1 GB | 72 |
| Solar 10.7B Instruct11B | Q4_K_M | 7.6 GB | +248.4 GB | 125 |
| Falcon 3 10B Instruct10B | Q4_K_M | 7.28 GB | +248.7 GB | 118 |
| Gemma 2 9B Instruct9B | Q8_0 | 11.7 GB | +244.3 GB | 108 |
7B · 20
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| GLM-4-9B-Chat9B | Q8_0 | 10.16 GB | +245.8 GB | 105 |
| Qwen3-VL 8B Instruct8B | Q8_0 | 10.39 GB | +245.6 GB | 108 |
| Ministral 3 8B Instruct8B | Q8_0 | 10.02 GB | +246 GB | — |
| Qwen2-VL 7B Instruct7B | Q4_K_M | 5.49 GB | +250.5 GB | 72 |
| Granite 3.1 8B Instruct8B | Q4_K_M | 5.88 GB | +250.1 GB | 142 |
| Qwen3 8B Instruct8B | Q6_K | 7.64 GB | +248.4 GB | 122 |
| Llama 3.1 8B Instruct8B | Q8_0 | 9.47 GB | +246.5 GB | 118 |
| Nous Hermes 3 Llama 3.1 8B8B | EXL2 4.65bpw | 5.43 GB | +250.6 GB | 232 |
| Aya 23 8B8B | Q4_K_M | 5.64 GB | +250.4 GB | 145 |
| OpenChat 3.6 8B8B | EXL2 4.65bpw | 5.43 GB | +250.6 GB | 228 |
| DeepSeek-R1-Distill-Llama-8B8B | Q5_K_M | 6.51 GB | +249.5 GB | 128 |
| InternLM2 7B Chat7B | Q4_K_M | 5.45 GB | +250.6 GB | 148 |
| Qwen2.5 7B Instruct7B | Q6_K | 6.77 GB | +249.2 GB | 132 |
| Qwen2.5-Coder 7B Instruct7B | EXL2 4.65bpw | 4.87 GB | +251.1 GB | 248 |
| WizardLM-2 7B7B | Q4_K_M | 5.07 GB | +250.9 GB | 152 |
| DeepSeek-R1-Distill-Qwen-7B7B | EXL2 4.65bpw | 4.87 GB | +251.1 GB | 210 |
| OLMo 2 7B Instruct7B | Q8_0 | 10.3 GB | +245.7 GB | 125 |
| Mistral 7B Instruct v0.37B | Q6_K | 6.75 GB | +249.3 GB | 135 |
| Zephyr 7B Beta7B | Q6_K | 6.75 GB | +249.3 GB | 132 |
| Gemma 3 4B IT4B | Q8_0 | 5.36 GB | +250.6 GB | 145 |
≤3B · 10
| 模型 | 量化档位 | 预估显存 | 余量 | tok/s |
|---|---|---|---|---|
| Qwen3 4B Instruct4B | Q6_K | 4.05 GB | +252 GB | 145 |
| Phi-4 Mini Instruct3.8B | Q8_0 | 4.68 GB | +251.3 GB | 262 |
| Phi-3.5 Mini Instruct3.8B | Q8_0 | 5.89 GB | +250.1 GB | 255 |
| Llama 3.2 3B Instruct3B | Q8_0 | 4.05 GB | +252 GB | 285 |
| Qwen2.5 3B Instruct3B | Q8_0 | 3.67 GB | +252.3 GB | 290 |
| Gemma 2 2B Instruct2B | Q8_0 | 3.34 GB | +252.7 GB | 320 |
| Qwen3 1.7B Instruct1.7B | Q8_0 | 2.39 GB | +253.6 GB | 240 |
| Qwen2.5 1.5B Instruct1.5B | Q8_0 | 1.83 GB | +254.2 GB | 410 |
| Llama 3.2 1B Instruct1B | Q8_0 | 1.51 GB | +254.5 GB | 450 |
| Qwen2.5 0.5B Instruct0.5B | Q8_0 | 0.6 GB | +255.4 GB | 540 |
这个列表是怎么算出来的
每一行取该模型中困惑度损失最低、且预估总量(权重 + 4K 上下文下的 KV 缓存 + 激活缓冲)不超过显存 88% 的量化档位。88% 是计算器的"绿色"阈值,因此这里每一行都留有真实余量,而不是刚好装下。提高上下文长度,列表会变短;计算器可直接验证任意组合。
在这张卡上的实测数据
本索引中没有在 Mac M5 Ultra 256G 上跑出的基准记录。本页所有数字都是根据模型架构与量化档位计算得出的估算,不是实测值。
再往上一档
Mac M5 Ultra 512G(512GB)比这张卡多装下 3 个索引内的模型。 Mac M5 Ultra 512G →
在 256GB、4K 上下文下,索引中 81 个模型有 78 个可从容运行,各自取仍留有余量的最高质量档位。