前置条件
需要 Windows 11(或 Win10 21H2+)、NVIDIA 显卡和最新 Windows 驱动。WSL2 CUDA 无需单独安装 Linux 驱动。
powershell
# In PowerShell (Admin)
wsl --install
wsl --update
# Verify GPU visible inside WSL
wsl nvidia-smi在 WSL 中安装 Ollama
在 Ubuntu WSL 内安装(非 Windows 原生版),GPU 兼容性最佳。Windows 侧通过 localhost:11434 访问 API。
bash
curl -fsSL https://ollama.com/install.sh | sh
ollama pull qwen2.5:7b
ollama run qwen2.5:7b
# From Windows browser or PowerShell:
# curl http://localhost:11434/api/tags接下来
看看 🟢 RTX 4060 Ti 16G 还能跑哪些模型反向查询 —— 16GB、8192 上下文,按质量排序本文涉及的模型
相关指南
入门端侧 / 本地6 分钟阅读
Windows 原生 Ollama(不用 WSL)
安装 Windows 版 Ollama 最简单 — NVIDIA 可用 GPU;AMD 目前仅 CPU。
入门端侧 / 本地9 分钟阅读
Windows + CUDA 运行 llama.cpp
Windows 11 上编译带 NVIDIA GPU 支持的 llama.cpp — PC 玩家的最简路径。
进阶端侧 / 本地9 分钟阅读
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。