Mac M4 Max 128G — what LLMs can it run?
75 of 81 indexed models fit comfortably in 128GB at 4K context, each at the highest-quality quant that still leaves headroom.
70B+ · 9
| Model | Quant | Est. VRAM | Headroom | tok/s |
|---|---|---|---|---|
| DBRX Instruct132B | Q4_K_M | 84.31 GB | +43.7 GB | 15 |
| GPT-OSS 120B117B MoE | MXFP4 | 65.15 GB | +62.9 GB | 22 |
| Llama 4 Scout 17B (16E)109B MoE | Q4_K_M | 69.88 GB | +58.1 GB | 22 |
| GLM-4.5-Air106B MoE | Q4_K_M | 67.94 GB | +60.1 GB | 18 |
| Llama 3.2 90B Vision Instruct90B | Q4_K_M | 57.5 GB | +70.5 GB | 22 |
| Qwen2.5 72B Instruct72B | Q5_K_M | 55.31 GB | +72.7 GB | 24 |
| Llama 3.1 70B Instruct70B | Q5_K_M | 53.75 GB | +74.3 GB | 32 |
| Llama 3.3 70B Instruct70B | Q5_K_M | 53.75 GB | +74.3 GB | 32 |
| DeepSeek-R1-Distill-Llama-70B70B | Q4_K_M | 46.1 GB | +81.9 GB | 36 |
32B · 19
| Model | Quant | Est. VRAM | Headroom | tok/s |
|---|---|---|---|---|
| Mixtral 8x7B Instruct47B MoE | Q4_K_M | 30.13 GB | +97.9 GB | 48 |
| Seed-OSS 36B Instruct36B | Q5_K_M | 27.81 GB | +100.2 GB | 37 |
| Command R 35B35B | Q4_K_M | 22.86 GB | +105.1 GB | 42 |
| Yi 1.5 34B Chat34B | Q4_K_M | 22.82 GB | +105.2 GB | 40 |
| Qwen3 32B Instruct32B | Q4_K_M | 21.85 GB | +106.2 GB | 42 |
| Qwen2.5 32B Instruct32B | Q4_K_M | 21.69 GB | +106.3 GB | 44 |
| Qwen2.5-Coder 32B Instruct32B | Q4_K_M | 21.69 GB | +106.3 GB | 44 |
| DeepSeek-R1-Distill-Qwen-32B32B | Q4_K_M | 21.69 GB | +106.3 GB | 42 |
| Qwen3 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +105 GB | 82 |
| Qwen3-Coder 30B-A3B Instruct30B-A3B | Q5_K_M | 23.04 GB | +105 GB | 80 |
| Qwen3-VL 30B-A3B Instruct30B-A3B | Q8_0 | 34.28 GB | +93.7 GB | 78 |
| Qwen3.8 27B27B | Q4_K_M | 17.47 GB | +110.5 GB | — |
| Gemma 3 27B IT27B | Q4_K_M | 19.49 GB | +108.5 GB | 48 |
| Gemma 2 27B Instruct27B | Q5_K_M | 21.76 GB | +106.2 GB | 42 |
| Mistral Small 24B Instruct24B | EXL2 4.65bpw | 15.26 GB | +112.7 GB | 88 |
| Devstral Small 1.1 24B24B | Q6_K | 20.91 GB | +107.1 GB | 48 |
| Magistral Small 1.2 24B24B | Q6_K | 20.91 GB | +107.1 GB | 47 |
| Codestral 22B22B | Q4_K_M | 15.03 GB | +113 GB | 58 |
| GPT-OSS 20B21B MoE | MXFP4 | 11.81 GB | +116.2 GB | 195 |
14B · 17
| Model | Quant | Est. VRAM | Headroom | tok/s |
|---|---|---|---|---|
| InternLM2 20B Chat20B | Q5_K_M | 15.59 GB | +112.4 GB | 68 |
| DeepSeek-Coder-V2-Lite Instruct16B | Q8_0 | 18.36 GB | +109.6 GB | 118 |
| DeepSeek-V2-Lite Chat16B | Q4_K_M | 10.87 GB | +117.1 GB | 142 |
| StarCoder2 15B15B | Q4_K_M | 10.19 GB | +117.8 GB | 92 |
| Qwen3 14B Instruct14B | Q5_K_M | 11.65 GB | +116.4 GB | 78 |
| Qwen2.5 14B Instruct14B | Q5_K_M | 11.73 GB | +116.3 GB | 86 |
| DeepSeek-R1-Distill-Qwen-14B14B | EXL2 4.65bpw | 9.75 GB | +118.3 GB | 128 |
| Phi-4 14B14B | Q5_K_M | 11.77 GB | +116.2 GB | 78 |
| Phi-3 Medium 14B Instruct14B | Q6_K | 12.86 GB | +115.1 GB | 88 |
| Mistral Nemo 12B Instruct12B | Q6_K | 11.14 GB | +116.9 GB | 95 |
| Gemma 3 12B IT12B | Q5_K_M | 10.6 GB | +117.4 GB | 92 |
| Stable LM 2 12B Chat12B | Q4_K_M | 8.35 GB | +119.7 GB | 108 |
| Jamba 1.5 Mini12B | Q4_K_M | 8.15 GB | +119.9 GB | 95 |
| Llama 3.2 11B Vision Instruct11B | Q8_0 | 12.9 GB | +115.1 GB | 72 |
| Solar 10.7B Instruct11B | Q4_K_M | 7.6 GB | +120.4 GB | 125 |
| Falcon 3 10B Instruct10B | Q4_K_M | 7.28 GB | +120.7 GB | 118 |
| Gemma 2 9B Instruct9B | Q8_0 | 11.7 GB | +116.3 GB | 108 |
7B · 20
| Model | Quant | Est. VRAM | Headroom | tok/s |
|---|---|---|---|---|
| GLM-4-9B-Chat9B | Q8_0 | 10.16 GB | +117.8 GB | 105 |
| Qwen3-VL 8B Instruct8B | Q8_0 | 10.39 GB | +117.6 GB | 108 |
| Ministral 3 8B Instruct8B | Q8_0 | 10.02 GB | +118 GB | — |
| Qwen2-VL 7B Instruct7B | Q4_K_M | 5.49 GB | +122.5 GB | 72 |
| Granite 3.1 8B Instruct8B | Q4_K_M | 5.88 GB | +122.1 GB | 142 |
| Qwen3 8B Instruct8B | Q6_K | 7.64 GB | +120.4 GB | 122 |
| Llama 3.1 8B Instruct8B | Q8_0 | 9.47 GB | +118.5 GB | 118 |
| Nous Hermes 3 Llama 3.1 8B8B | EXL2 4.65bpw | 5.43 GB | +122.6 GB | 232 |
| Aya 23 8B8B | Q4_K_M | 5.64 GB | +122.4 GB | 145 |
| OpenChat 3.6 8B8B | EXL2 4.65bpw | 5.43 GB | +122.6 GB | 228 |
| DeepSeek-R1-Distill-Llama-8B8B | Q5_K_M | 6.51 GB | +121.5 GB | 128 |
| InternLM2 7B Chat7B | Q4_K_M | 5.45 GB | +122.6 GB | 148 |
| Qwen2.5 7B Instruct7B | Q6_K | 6.77 GB | +121.2 GB | 132 |
| Qwen2.5-Coder 7B Instruct7B | EXL2 4.65bpw | 4.87 GB | +123.1 GB | 248 |
| WizardLM-2 7B7B | Q4_K_M | 5.07 GB | +122.9 GB | 152 |
| DeepSeek-R1-Distill-Qwen-7B7B | EXL2 4.65bpw | 4.87 GB | +123.1 GB | 210 |
| OLMo 2 7B Instruct7B | Q8_0 | 10.3 GB | +117.7 GB | 125 |
| Mistral 7B Instruct v0.37B | Q6_K | 6.75 GB | +121.3 GB | 135 |
| Zephyr 7B Beta7B | Q6_K | 6.75 GB | +121.3 GB | 132 |
| Gemma 3 4B IT4B | Q8_0 | 5.36 GB | +122.6 GB | 145 |
≤3B · 10
| Model | Quant | Est. VRAM | Headroom | tok/s |
|---|---|---|---|---|
| Qwen3 4B Instruct4B | Q6_K | 4.05 GB | +124 GB | 145 |
| Phi-4 Mini Instruct3.8B | Q8_0 | 4.68 GB | +123.3 GB | 262 |
| Phi-3.5 Mini Instruct3.8B | Q8_0 | 5.89 GB | +122.1 GB | 255 |
| Llama 3.2 3B Instruct3B | Q8_0 | 4.05 GB | +124 GB | 285 |
| Qwen2.5 3B Instruct3B | Q8_0 | 3.67 GB | +124.3 GB | 290 |
| Gemma 2 2B Instruct2B | Q8_0 | 3.34 GB | +124.7 GB | 320 |
| Qwen3 1.7B Instruct1.7B | Q8_0 | 2.39 GB | +125.6 GB | 240 |
| Qwen2.5 1.5B Instruct1.5B | Q8_0 | 1.83 GB | +126.2 GB | 410 |
| Llama 3.2 1B Instruct1B | Q8_0 | 1.51 GB | +126.5 GB | 450 |
| Qwen2.5 0.5B Instruct0.5B | Q8_0 | 0.6 GB | +127.4 GB | 540 |
How this list is built
Each row is the lowest-perplexity-loss quant of that model whose estimated total — weights plus KV cache at 4K context plus activation buffer — uses at most 88% of the card. That is the calculator's "green" threshold, so every row here has real headroom rather than only just fitting. Raise the context length and the list shortens; the calculator lets you check any combination directly.
A further 1 models load but with no headroom to spare (up to 105% of VRAM) — the Quant Hub’s GPU chips count those too, which is why its number is higher.
Measured on this card
No benchmark runs in this index were recorded on a Mac M4 Max 128G. Every figure on this page is calculated from the model architecture and the quant level — treat them as estimates, not measurements.
Cards with the same budget
What fits is decided by memory, so every 128GB card of this type returns the same list. These pages are not different answers — they differ in throughput, which this index does not measure per card.
Stepping up
A Mac M3 Ultra 192G (192GB) fits 1 more of the indexed models than this card. Mac M3 Ultra 192G →
75 of 81 indexed models fit comfortably in 128GB at 4K context, each at the highest-quality quant that still leaves headroom.