实战部署指南
经过验证的大模型真机部署教程
在 €20/月 VPS 上运行 Llama 3.1 8B
使用 llama.cpp 服务模式在低价 Linux VPS 上搭建私有 LLM API 的完整教程。
Mac M3 Max:本地大模型终极配置
用 Ollama 榨干苹果芯片性能,运行多个模型,搭建 OpenAI 兼容 API,调优 Metal GPU 层数。
用 vLLM 在 RTX 4090 上搭建多模型 API 服务
用 vLLM 的连续批处理技术,在单张 RTX 4090 上提供生产级多模型 API 服务。
Docker Compose LLM 全家桶:Ollama + Open WebUI
一键部署的 Docker Compose 方案,给你一个本地 ChatGPT 体验。
RTX 4060 Ti 16G 能跑什么模型?
英伟达最佳 16GB 入门卡的模型与量化级别选型指南。
DeepSeek-R1 Distill 14B:EXL2 vs GGUF 对比
RTX 4090 实测对比 — 何时选 turboderp EXL2 而非 bartowski GGUF。
RTX 4090 上 ExLlamaV2 完整配置
10 分钟内安装 ExLlamaV2、加载 EXL2 量化并提供 OpenAI 兼容 API。
双 RTX 3090 跑 70B(llama.cpp)
用 llama.cpp 把 70B GGUF 拆到两张 24GB 卡上 —— 到底能装下多少、自动适配开启后哪些参数要紧、装不下时改什么。
单卡 RTX 4090 运行 Qwen2.5-Coder 32B
Qwen2.5-Coder 32B 的哪个版本在多长的上下文下能装进 24GB 显卡,以及需要 32K 时该换用的 MoE 代码模型。
Mac M3 Pro:真实的模型上限
统一内存并不全归你用 —— 18GB 与 36GB 的 M3 Pro 实际能装下什么,以及决定这一点的 Metal 上限。
Windows + CUDA 运行 llama.cpp
Windows 11 上编译带 NVIDIA GPU 支持的 llama.cpp — PC 玩家的最简路径。
TabbyAPI:EXL3 的 OpenAI 兼容服务端
TabbyAPI 现在服务的是 ExLlamaV3(EXL3 和 FP16),不再是 EXL2 —— 变了什么、现在怎么跑,以及手里的 EXL2 模型该怎么办。
将自己的模型量化为 GGUF
用 llama.cpp 的 quantize 工具将任意 HF 模型转为 GGUF Q4_K_M 本地推理。
vLLM + AWQ 生产环境调优指南
gpu-memory-utilization、max-model-len 和批处理参数的生产级 API 调优。
CPU 推理:llama.cpp OpenBLAS 调优
在纯 CPU VPS 上通过线程数和 BLAS 后端调优最大化 tok/s。
8GB 显卡入门指南:3060 / 4060 / 3070
最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。
M1 / M2 Mac 8GB:Ollama 真实能力边界
统一内存与 macOS 共享 — 入门 MacBook 不触发 swap 的情况下能跑什么。
Windows WSL2 + Ollama GPU 透传
在 WSL2 内用 NVIDIA GPU 加速运行 Ollama — Windows 本地 LLM 最稳妥的路线。
Docker:Ollama 的 NVIDIA / AMD GPU 透传
容器化 Ollama 并启用 GPU — 隔离模型、固定版本、与其他服务共存。
Nginx 反向代理本地 LLM API
用 Nginx 为 Ollama 或 llama.cpp 提供 TLS、限流和稳定的 /v1 端点。
AMD 显卡 + llama.cpp ROCm 快速入门
用 llama.cpp HIP 后端在 RX 7900 / 6800 系列上跑 GGUF — 能做什么、不能做什么。
Windows 原生 Ollama(不用 WSL)
安装 Windows 版 Ollama 最简单 —— NVIDIA 和 AMD Radeon 显卡都能用 GPU,不用 WSL,也不用装工具包。
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
Intel Arc 显卡:llama.cpp(SYCL)或 Ollama(Vulkan)
在 Arc B580、B570、A770、A750 上跑 GGUF —— SYCL 编译、Ollama 路线、如何确认真的在用 GPU,以及 8–16 GB 能装下什么。
12GB 显卡能跑什么(RTX 3060 12G、4070、5070)
12GB NVIDIA 显卡在 8K–32K 上下文下能装下哪些模型、14B 从哪里开始装不下、如何用 Ollama 或 llama.cpp 运行,以及如何确认确实跑在 GPU 上。
RTX 5090:32GB 显存在本地大模型上到底多出什么
RTX 5090 能装下而 24GB 卡装不下的是什么:模型数量没多几个,但上下文长得多、速度上限更高。数字来自计算器,附 Blackwell 的配置要点。
DGX Spark 64GB 与 128GB:各自能跑什么
64GB 和 128GB 两款 DGX Spark 各能装下哪些模型(数字来自计算器):GPT-OSS 120B 需要 128GB 版,70B 稠密模型两款都能装,速度由 273 GB/s 决定。附 Ollama 与 llama.cpp 配置。