内存预算
macOS 和常用应用占 3–4GB,8GB Mac 仅剩约 4GB 给模型。建议 3B Q4 或 7B Q2/Q3 + 短上下文,加载 7B 前关闭浏览器。
text
M1 8GB safe picks:
llama3.2:3b → smooth chat
qwen2.5:3b → good Chinese
phi3.5:mini → fast responses
Avoid on 8GB:
llama3.1:8b @ Q4 → swap thrashing
any 14B+ modelOllama 设置
设置 OLLAMA_NUM_PARALLEL=1,8GB 机器上下文保持 2048。在活动监视器观察内存压力。
bash
export OLLAMA_NUM_PARALLEL=1
export OLLAMA_MAX_LOADED_MODELS=1
ollama pull llama3.2:3b
ollama run llama3.2:3b相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。