为什么选 vLLM + AWQ?
vLLM 的 PagedAttention 和连续批处理比朴素推理吞吐高 3-5 倍。AWQ 是 NVIDIA INT4 下精度最优的量化格式。
text
Model: Qwen2.5-7B-Instruct-AWQ
Hardware: RTX 4090 24GB
Throughput: ~220 tok/s (batch=1), ~1400 tok/s (batch=8)
VRAM used: 4.8 GB weights + KV cache安装 vLLM
在 CUDA 12.1 虚拟环境中安装 vLLM。
bash
python3 -m venv venv && source venv/bin/activate
pip install vllm --extra-index-url https://download.pytorch.org/whl/cu121启动服务
启动支持量化的 OpenAI 兼容服务器。
bash
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct-AWQ \
--quantization awq \
--max-model-len 32768 \
--gpu-memory-utilization 0.85 \
--port 8000相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。