安装 Ollama
一行命令安装。Ollama 自动检测苹果芯片并启用 Metal GPU 加速。
bash
curl -fsSL https://ollama.com/install.sh | sh拉取并运行模型
Ollama 默认使用 Q4_K_M GGUF。有 Qwen3 8B 时优先拉取,推理更强。
bash
# Pull Llama 3.1 8B (default Q4_K_M, ~5.7 GB)
ollama pull llama3.1:8b
# Stronger 2026 default for multilingual + thinking:
# ollama pull qwen3:8b
# Or Qwen2.5 7B
ollama pull qwen2.5:7b
# Run interactively
ollama run llama3.1:8bOpenAI 兼容 API
Ollama 在 11434 端口暴露 OpenAI 兼容 API,可直接替换任何使用 OpenAI SDK 的应用。
bash
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3.1:8b","messages":[{"role":"user","content":"Hello!"}]}'相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。