进阶服务器 / VPS 12 分钟阅读

用 vLLM 在 RTX 4090 上搭建多模型 API 服务

用 vLLM 的连续批处理技术,在单张 RTX 4090 上提供生产级多模型 API 服务。

已验证技术栈

CUDA 12.1+ · vLLM 0.6+ · AWQ INT4 · RTX 4090 24GB · OpenAI API :8000

最近验证 2026-07-22

vLLMAWQNVIDIARTX 4090APIDocker

为什么选 vLLM + AWQ?

vLLM 的 PagedAttention 和连续批处理比朴素推理吞吐高 3-5 倍。AWQ 是 NVIDIA INT4 下精度最优的量化格式。

text
Model: Qwen2.5-7B-Instruct-AWQ
Hardware: RTX 4090 24GB
Throughput: ~220 tok/s (batch=1), ~1400 tok/s (batch=8)
VRAM used: 4.8 GB weights + KV cache

安装 vLLM

在 CUDA 12.1 虚拟环境中安装 vLLM。

bash
python3 -m venv venv && source venv/bin/activate
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu121

启动服务

启动支持量化的 OpenAI 兼容服务器。

bash
python -m vllm.entrypoints.openai.api_server \
  --model Qwen/Qwen2.5-7B-Instruct-AWQ \
  --quantization awq \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.85 \
  --port 8000

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。