显存调优
从 0.85 gpu-memory-utilization 开始。长上下文 OOM 时降至 0.75。
bash
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct-AWQ \
--quantization awq \
--gpu-memory-utilization 0.85 \
--max-model-len 32768 \
--max-num-seqs 32相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。