前置条件
安装 Visual Studio Build Tools、CMake 和 CUDA Toolkit 12.x。
powershell
winget install Kitware.CMake
# CUDA: download from developer.nvidia.com/cuda-downloads编译
CMake 配置时启用 CUDA 后端。
powershell
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DLLAMA_CUDA=ON
cmake --build build --config Release -j相关指南
高级端侧 / 本地12 分钟阅读
将自己的模型量化为 GGUF
用 llama.cpp 的 quantize 工具将任意 HF 模型转为 GGUF Q4_K_M 本地推理。
进阶端侧 / 本地10 分钟阅读
Windows WSL2 + Ollama GPU 透传
在 WSL2 内用 NVIDIA GPU 加速运行 Ollama — Windows 本地 LLM 最稳妥的路线。
进阶端侧 / 本地9 分钟阅读
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。