实战部署指南
经过验证的大模型真机部署教程
在 €20/月 VPS 上运行 Llama 3.1 8B
使用 llama.cpp 服务模式在低价 Linux VPS 上搭建私有 LLM API 的完整教程。
Mac M3 Max:本地大模型终极配置
用 Ollama 榨干苹果芯片性能,运行多个模型,搭建 OpenAI 兼容 API,调优 Metal GPU 层数。
用 vLLM 在 RTX 4090 上搭建多模型 API 服务
用 vLLM 的连续批处理技术,在单张 RTX 4090 上提供生产级多模型 API 服务。
Docker Compose LLM 全家桶:Ollama + Open WebUI
一键部署的 Docker Compose 方案,给你一个本地 ChatGPT 体验。
RTX 4060 Ti 16G 能跑什么模型?
英伟达最佳 16GB 入门卡的模型与量化级别选型指南。
DeepSeek-R1 Distill 14B:EXL2 vs GGUF 对比
RTX 4090 实测对比 — 何时选 turboderp EXL2 而非 bartowski GGUF。
RTX 4090 上 ExLlamaV2 完整配置
10 分钟内安装 ExLlamaV2、加载 EXL2 量化并提供 OpenAI 兼容 API。
双 RTX 3090 运行 70B(llama.cpp)
双 24GB 卡张量切分,运行 Llama 3.1 70B 或 Qwen2.5 72B Q4 量化。
单卡 RTX 4090 运行 Qwen2.5-Coder 32B
24GB 能装下的最佳开源代码模型 — 量化选择与调优技巧。
Mac M3 Pro:实际模型运行极限
18GB 或 36GB 统一内存下,Ollama 和 llama.cpp 实际能跑什么。
Windows + CUDA 运行 llama.cpp
Windows 11 上编译带 NVIDIA GPU 支持的 llama.cpp — PC 玩家的最简路径。
TabbyAPI:带 Web UI 的 ExLlamaV2 服务
用 TabbyAPI 封装 ExLlamaV2,获得流式输出和模型热切换的 OpenAI 兼容服务。
将自己的模型量化为 GGUF
用 llama.cpp 的 quantize 工具将任意 HF 模型转为 GGUF Q4_K_M 本地推理。
vLLM + AWQ 生产环境调优指南
gpu-memory-utilization、max-model-len 和批处理参数的生产级 API 调优。
CPU 推理:llama.cpp OpenBLAS 调优
在纯 CPU VPS 上通过线程数和 BLAS 后端调优最大化 tok/s。
8GB 显卡入门指南:3060 / 4060 / 3070
最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。
M1 / M2 Mac 8GB:Ollama 真实能力边界
统一内存与 macOS 共享 — 入门 MacBook 不触发 swap 的情况下能跑什么。
Windows WSL2 + Ollama GPU 透传
在 WSL2 内用 NVIDIA GPU 加速运行 Ollama — Windows 本地 LLM 最稳妥的路线。
Docker:Ollama NVIDIA GPU 透传
容器化 Ollama 并启用 GPU — 隔离模型、固定版本、与其他服务共存。
Nginx 反向代理本地 LLM API
用 Nginx 为 Ollama 或 llama.cpp 提供 TLS、限流和稳定的 /v1 端点。
AMD 显卡 + llama.cpp ROCm 快速入门
用 llama.cpp HIP 后端在 RX 7900 / 6800 系列上跑 GGUF — 能做什么、不能做什么。
Windows 原生 Ollama(不用 WSL)
安装 Windows 版 Ollama 最简单 — NVIDIA 可用 GPU;AMD 目前仅 CPU。
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。