Ollama 基础反代
Ollama 提供 OpenAI 兼容的 /v1/chat/completions。反代时需设长超时 — LLM 响应较慢。
nginx
server {
listen 443 ssl;
server_name llm.example.com;
ssl_certificate /etc/letsencrypt/live/llm.example.com/fullchain.pem;
ssl_certificate_key /etc/letsencrypt/live/llm.example.com/privkey.pem;
location /v1/ {
proxy_pass http://127.0.0.1:11434/v1/;
proxy_read_timeout 300s;
proxy_send_timeout 300s;
client_max_body_size 10m;
}
}限流
对公网 VPS 加 limit_req 防滥用,按预期用户数调整速率。
nginx
limit_req_zone $binary_remote_addr zone=llm:10m rate=10r/m;
location /v1/ {
limit_req zone=llm burst=5 nodelay;
proxy_pass http://127.0.0.1:11434/v1/;
proxy_read_timeout 300s;
}相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。