进阶服务器 / VPS 11 分钟阅读

Nginx 反向代理本地 LLM API

用 Nginx 为 Ollama 或 llama.cpp 提供 TLS、限流和稳定的 /v1 端点。

已验证技术栈

Nginx · TLS · proxy_read_timeout 300s · Ollama/llama.cpp /v1 · 限流

最近验证 2026-07-22

NginxAPITLSOllamallama.cpp

Ollama 基础反代

Ollama 提供 OpenAI 兼容的 /v1/chat/completions。反代时需设长超时 — LLM 响应较慢。

nginx
server {
    listen 443 ssl;
    server_name llm.example.com;

    ssl_certificate     /etc/letsencrypt/live/llm.example.com/fullchain.pem;
    ssl_certificate_key /etc/letsencrypt/live/llm.example.com/privkey.pem;

    location /v1/ {
        proxy_pass http://127.0.0.1:11434/v1/;
        proxy_read_timeout 300s;
        proxy_send_timeout 300s;
        client_max_body_size 10m;
    }
}

限流

对公网 VPS 加 limit_req 防滥用,按预期用户数调整速率。

nginx
limit_req_zone $binary_remote_addr zone=llm:10m rate=10r/m;

location /v1/ {
    limit_req zone=llm burst=5 nodelay;
    proxy_pass http://127.0.0.1:11434/v1/;
    proxy_read_timeout 300s;
}

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。