实战部署指南

经过验证的大模型真机部署教程

入门服务器 / VPS
3 分钟阅读

在 €20/月 VPS 上运行 Llama 3.1 8B

使用 llama.cpp 服务模式在低价 Linux VPS 上搭建私有 LLM API 的完整教程。

llama.cppVPSLinuxGGUF
阅读指南 →
入门Mac / 苹果
3 分钟阅读

Mac M3 Max:本地大模型终极配置

用 Ollama 榨干苹果芯片性能,运行多个模型,搭建 OpenAI 兼容 API,调优 Metal GPU 层数。

OllamaMacApple SiliconMetal
阅读指南 →
进阶服务器 / VPS
2 分钟阅读

用 vLLM 在 RTX 4090 上搭建多模型 API 服务

用 vLLM 的连续批处理技术,在单张 RTX 4090 上提供生产级多模型 API 服务。

vLLMAWQNVIDIARTX 4090
阅读指南 →
入门Docker
4 分钟阅读

Docker Compose LLM 全家桶:Ollama + Open WebUI

一键部署的 Docker Compose 方案,给你一个本地 ChatGPT 体验。

DockerOllamaOpen WebUICompose
阅读指南 →
入门端侧 / 本地
2 分钟阅读

RTX 4060 Ti 16G 能跑什么模型?

英伟达最佳 16GB 入门卡的模型与量化级别选型指南。

RTX 4060 TiGGUFEXL2VRAM
阅读指南 →
进阶端侧 / 本地
2 分钟阅读

DeepSeek-R1 Distill 14B:EXL2 vs GGUF 对比

RTX 4090 实测对比 — 何时选 turboderp EXL2 而非 bartowski GGUF。

DeepSeek-R1EXL2GGUFExLlamaV2
阅读指南 →
进阶端侧 / 本地
3 分钟阅读

RTX 4090 上 ExLlamaV2 完整配置

10 分钟内安装 ExLlamaV2、加载 EXL2 量化并提供 OpenAI 兼容 API。

ExLlamaV2EXL2RTX 4090API
阅读指南 →
高级服务器 / VPS
4 分钟阅读

双 RTX 3090 跑 70B(llama.cpp)

用 llama.cpp 把 70B GGUF 拆到两张 24GB 卡上 —— 到底能装下多少、自动适配开启后哪些参数要紧、装不下时改什么。

70BMulti-GPUllama.cppRTX 3090
阅读指南 →
进阶端侧 / 本地
3 分钟阅读

单卡 RTX 4090 运行 Qwen2.5-Coder 32B

Qwen2.5-Coder 32B 的哪个版本在多长的上下文下能装进 24GB 显卡,以及需要 32K 时该换用的 MoE 代码模型。

Qwen2.5-Coder32BRTX 4090GGUF
阅读指南 →
入门Mac / 苹果
3 分钟阅读

Mac M3 Pro:真实的模型上限

统一内存并不全归你用 —— 18GB 与 36GB 的 M3 Pro 实际能装下什么,以及决定这一点的 Metal 上限。

MacM3 ProApple SiliconOllama
阅读指南 →
入门端侧 / 本地
3 分钟阅读

Windows + CUDA 运行 llama.cpp

Windows 11 上编译带 NVIDIA GPU 支持的 llama.cpp — PC 玩家的最简路径。

Windowsllama.cppCUDAGGUF
阅读指南 →
进阶服务器 / VPS
3 分钟阅读

TabbyAPI:EXL3 的 OpenAI 兼容服务端

TabbyAPI 现在服务的是 ExLlamaV3(EXL3 和 FP16),不再是 EXL2 —— 变了什么、现在怎么跑,以及手里的 EXL2 模型该怎么办。

TabbyAPIExLlamaV3EXL3API
阅读指南 →
高级端侧 / 本地
3 分钟阅读

将自己的模型量化为 GGUF

用 llama.cpp 的 quantize 工具将任意 HF 模型转为 GGUF Q4_K_M 本地推理。

GGUFllama.cppquantizecustom
阅读指南 →
高级服务器 / VPS
2 分钟阅读

vLLM + AWQ 生产环境调优指南

gpu-memory-utilization、max-model-len 和批处理参数的生产级 API 调优。

vLLMAWQproductionAPI
阅读指南 →
进阶服务器 / VPS
3 分钟阅读

CPU 推理:llama.cpp OpenBLAS 调优

在纯 CPU VPS 上通过线程数和 BLAS 后端调优最大化 tok/s。

CPUllama.cppOpenBLASVPS
阅读指南 →
入门端侧 / 本地
4 分钟阅读

8GB 显卡入门指南:3060 / 4060 / 3070

最常见的本地 LLM 硬件档位 — 8GB 显存能跑哪些模型、量化和上下文长度。

8GB VRAMRTX 3060RTX 4060GGUF
阅读指南 →
入门Mac / 苹果
2 分钟阅读

M1 / M2 Mac 8GB:Ollama 真实能力边界

统一内存与 macOS 共享 — 入门 MacBook 不触发 swap 的情况下能跑什么。

M1M28GB RAMOllama
阅读指南 →
进阶端侧 / 本地
4 分钟阅读

Windows WSL2 + Ollama GPU 透传

在 WSL2 内用 NVIDIA GPU 加速运行 Ollama — Windows 本地 LLM 最稳妥的路线。

WSL2WindowsOllamaNVIDIA
阅读指南 →
进阶Docker
4 分钟阅读

Docker:Ollama 的 NVIDIA / AMD GPU 透传

容器化 Ollama 并启用 GPU — 隔离模型、固定版本、与其他服务共存。

DockerOllamaNVIDIAAMD
阅读指南 →
进阶服务器 / VPS
4 分钟阅读

Nginx 反向代理本地 LLM API

用 Nginx 为 Ollama 或 llama.cpp 提供 TLS、限流和稳定的 /v1 端点。

NginxAPITLSOllama
阅读指南 →
高级端侧 / 本地
4 分钟阅读

AMD 显卡 + llama.cpp ROCm 快速入门

用 llama.cpp HIP 后端在 RX 7900 / 6800 系列上跑 GGUF — 能做什么、不能做什么。

AMDROCmllama.cppHIP
阅读指南 →
入门端侧 / 本地
4 分钟阅读

Windows 原生 Ollama(不用 WSL)

安装 Windows 版 Ollama 最简单 —— NVIDIA 和 AMD Radeon 显卡都能用 GPU,不用 WSL,也不用装工具包。

WindowsOllamaNVIDIAAMD
阅读指南 →
进阶端侧 / 本地
6 分钟阅读

本地运行 GPT-OSS 20B(及 120B)——不要重新量化

GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。

GPT-OSSMXFP4MoEllama.cpp
阅读指南 →
进阶端侧 / 本地
4 分钟阅读

Intel Arc 显卡:llama.cpp(SYCL)或 Ollama(Vulkan)

在 Arc B580、B570、A770、A750 上跑 GGUF —— SYCL 编译、Ollama 路线、如何确认真的在用 GPU,以及 8–16 GB 能装下什么。

Intel ArcSYCLllama.cppOllama
阅读指南 →
入门端侧 / 本地
4 分钟阅读

12GB 显卡能跑什么(RTX 3060 12G、4070、5070)

12GB NVIDIA 显卡在 8K–32K 上下文下能装下哪些模型、14B 从哪里开始装不下、如何用 Ollama 或 llama.cpp 运行,以及如何确认确实跑在 GPU 上。

12GBRTX 3060RTX 4070RTX 5070
阅读指南 →
进阶端侧 / 本地
3 分钟阅读

RTX 5090:32GB 显存在本地大模型上到底多出什么

RTX 5090 能装下而 24GB 卡装不下的是什么:模型数量没多几个,但上下文长得多、速度上限更高。数字来自计算器,附 Blackwell 的配置要点。

RTX 509032GBBlackwellllama.cpp
阅读指南 →
进阶端侧 / 本地
4 分钟阅读

DGX Spark 64GB 与 128GB:各自能跑什么

64GB 和 128GB 两款 DGX Spark 各能装下哪些模型(数字来自计算器):GPT-OSS 120B 需要 128GB 版,70B 稠密模型两款都能装,速度由 273 GB/s 决定。附 Ollama 与 llama.cpp 配置。

DGX SparkGB10unified memory64GB
阅读指南 →