入门Mac / 苹果 6 分钟阅读

Mac M3 Max:本地大模型终极配置

用 Ollama 榨干苹果芯片性能,运行多个模型,搭建 OpenAI 兼容 API,调优 Metal GPU 层数。

已验证技术栈

macOS 14+ · 苹果芯片 · Ollama 0.6+ · Metal · Qwen3-8B / Llama 3.1 8B Q4

最近验证 2026-07-22

OllamaMacApple SiliconMetalGGUF

安装 Ollama

一行命令安装。Ollama 自动检测苹果芯片并启用 Metal GPU 加速。

bash
curl -fsSL https://ollama.com/install.sh | sh

拉取并运行模型

Ollama 默认使用 Q4_K_M GGUF。有 Qwen3 8B 时优先拉取,推理更强。

bash
# Pull Llama 3.1 8B (default Q4_K_M, ~5.7 GB)
ollama pull llama3.1:8b

# Stronger 2026 default for multilingual + thinking:
# ollama pull qwen3:8b

# Or Qwen2.5 7B
ollama pull qwen2.5:7b

# Run interactively
ollama run llama3.1:8b

OpenAI 兼容 API

Ollama 在 11434 端口暴露 OpenAI 兼容 API,可直接替换任何使用 OpenAI SDK 的应用。

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.1:8b","messages":[{"role":"user","content":"Hello!"}]}'

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。