张量切分
用 --tensor-split 将层分布到多卡。Q4_K_M 70B 权重约 44GB,48GB 总量勉强可行。
bash
./build/bin/llama-server \
-m ./models/Llama-3.1-70B-Q4_K_M.gguf \
--tensor-split 24,24 \
-c 4096 -ngl 99 \
--host 0.0.0.0 --port 8080接下来
本文涉及的模型
相关指南
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。