实战部署指南

经过验证的大模型真机部署教程

入门服务器 / VPS
8 分钟阅读

在 €20/月 VPS 上运行 Llama 3.1 8B

使用 llama.cpp 服务模式在低价 Linux VPS 上搭建私有 LLM API 的完整教程。

llama.cppVPSLinuxGGUF
阅读指南 →
入门Mac / 苹果
6 分钟阅读

Mac M3 Max:本地大模型终极配置

用 Ollama 榨干苹果芯片性能,运行多个模型,搭建 OpenAI 兼容 API,调优 Metal GPU 层数。

OllamaMacApple SiliconMetal
阅读指南 →
进阶服务器 / VPS
12 分钟阅读

用 vLLM 在 RTX 4090 上搭建多模型 API 服务

用 vLLM 的连续批处理技术,在单张 RTX 4090 上提供生产级多模型 API 服务。

vLLMAWQNVIDIARTX 4090
阅读指南 →
入门Docker
5 分钟阅读

Docker Compose LLM 全家桶:Ollama + Open WebUI

一键部署的 Docker Compose 方案,给你一个本地 ChatGPT 体验。

DockerOllamaOpen WebUICompose
阅读指南 →
入门端侧 / 本地
7 分钟阅读

RTX 4060 Ti 16G 能跑什么模型?

英伟达最佳 16GB 入门卡的模型与量化级别选型指南。

RTX 4060 TiGGUFEXL2VRAM
阅读指南 →
进阶端侧 / 本地
9 分钟阅读

DeepSeek-R1 Distill 14B:EXL2 vs GGUF 对比

RTX 4090 实测对比 — 何时选 turboderp EXL2 而非 bartowski GGUF。

DeepSeek-R1EXL2GGUFExLlamaV2
阅读指南 →
进阶端侧 / 本地
10 分钟阅读

RTX 4090 上 ExLlamaV2 完整配置

10 分钟内安装 ExLlamaV2、加载 EXL2 量化并提供 OpenAI 兼容 API。

ExLlamaV2EXL2RTX 4090API
阅读指南 →
高级端侧 / 本地
11 分钟阅读

双 RTX 3090 运行 70B(llama.cpp)

双 24GB 卡张量切分,运行 Llama 3.1 70B 或 Qwen2.5 72B Q4 量化。

70BMulti-GPUllama.cpptensor-split
阅读指南 →
进阶端侧 / 本地
8 分钟阅读

单卡 RTX 4090 运行 Qwen2.5-Coder 32B

24GB 能装下的最佳开源代码模型 — 量化选择与调优技巧。

Qwen2.5-Coder32BRTX 4090GGUF
阅读指南 →
入门Mac / 苹果
6 分钟阅读

Mac M3 Pro:实际模型运行极限

18GB 或 36GB 统一内存下,Ollama 和 llama.cpp 实际能跑什么。

MacM3 ProOllamaUnified Memory
阅读指南 →
入门端侧 / 本地
9 分钟阅读

Windows + CUDA 运行 llama.cpp

Windows 11 上编译带 NVIDIA GPU 支持的 llama.cpp — PC 玩家的最简路径。

Windowsllama.cppCUDAGGUF
阅读指南 →
进阶服务器 / VPS
8 分钟阅读

TabbyAPI:带 Web UI 的 ExLlamaV2 服务

用 TabbyAPI 封装 ExLlamaV2,获得流式输出和模型热切换的 OpenAI 兼容服务。

TabbyAPIExLlamaV2APIEXL2
阅读指南 →
高级端侧 / 本地
12 分钟阅读

将自己的模型量化为 GGUF

用 llama.cpp 的 quantize 工具将任意 HF 模型转为 GGUF Q4_K_M 本地推理。

GGUFllama.cppquantizecustom
阅读指南 →
高级服务器 / VPS
10 分钟阅读

vLLM + AWQ 生产环境调优指南

gpu-memory-utilization、max-model-len 和批处理参数的生产级 API 调优。

vLLMAWQproductionAPI
阅读指南 →
进阶服务器 / VPS
7 分钟阅读

CPU 推理:llama.cpp OpenBLAS 调优

在纯 CPU VPS 上通过线程数和 BLAS 后端调优最大化 tok/s。

CPUllama.cppOpenBLASVPS
阅读指南 →
入门端侧 / 本地
8 分钟阅读

8GB 显卡入门指南:3060 / 4060 / 3070

最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。

8GB VRAMRTX 3060RTX 4060GGUF
阅读指南 →
入门Mac / 苹果
7 分钟阅读

M1 / M2 Mac 8GB:Ollama 真实能力边界

统一内存与 macOS 共享 — 入门 MacBook 不触发 swap 的情况下能跑什么。

M1M28GB RAMOllama
阅读指南 →
进阶端侧 / 本地
10 分钟阅读

Windows WSL2 + Ollama GPU 透传

在 WSL2 内用 NVIDIA GPU 加速运行 Ollama — Windows 本地 LLM 最稳妥的路线。

WSL2WindowsOllamaNVIDIA
阅读指南 →
进阶Docker
9 分钟阅读

Docker:Ollama NVIDIA GPU 透传

容器化 Ollama 并启用 GPU — 隔离模型、固定版本、与其他服务共存。

DockerOllamaNVIDIAGPU
阅读指南 →
进阶服务器 / VPS
11 分钟阅读

Nginx 反向代理本地 LLM API

用 Nginx 为 Ollama 或 llama.cpp 提供 TLS、限流和稳定的 /v1 端点。

NginxAPITLSOllama
阅读指南 →
高级端侧 / 本地
12 分钟阅读

AMD 显卡 + llama.cpp ROCm 快速入门

用 llama.cpp HIP 后端在 RX 7900 / 6800 系列上跑 GGUF — 能做什么、不能做什么。

AMDROCmllama.cppHIP
阅读指南 →
入门端侧 / 本地
6 分钟阅读

Windows 原生 Ollama(不用 WSL)

安装 Windows 版 Ollama 最简单 — NVIDIA 可用 GPU;AMD 目前仅 CPU。

WindowsOllamaNVIDIADesktop
阅读指南 →
进阶端侧 / 本地
9 分钟阅读

本地运行 GPT-OSS 20B(及 120B)——不要重新量化

GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。

GPT-OSSMXFP4MoEllama.cpp
阅读指南 →