进阶Docker 9 分钟阅读

Docker:Ollama NVIDIA GPU 透传

容器化 Ollama 并启用 GPU — 隔离模型、固定版本、与其他服务共存。

已验证技术栈

Docker 27+ · nvidia-container-toolkit · ollama/ollama 镜像

最近验证 2026-07-22

DockerOllamaNVIDIAGPUCompose

docker-compose.yml

宿主机需安装 NVIDIA Container Toolkit。deploy.resources 申请 1 块 GPU。模型存入 named volume 持久化。

yaml
services:
  ollama:
    image: ollama/ollama:latest
    container_name: ollama
    ports:
      - "11434:11434"
    volumes:
      - ollama_data:/root/.ollama
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    restart: unless-stopped

volumes:
  ollama_data:

启动并拉取模型

Linux 上用 docker compose v2。Windows Docker Desktop 需先启用 WSL2 后端和 GPU 支持。

bash
docker compose up -d
docker exec -it ollama ollama pull llama3.1:8b
docker exec -it ollama ollama run llama3.1:8b

# API test
curl http://localhost:11434/api/generate -d '{"model":"llama3.1:8b","prompt":"Hello","stream":false}'

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。