高级端侧 / 本地 11 分钟阅读

双 RTX 3090 运行 70B(llama.cpp)

双 24GB 卡张量切分,运行 Llama 3.1 70B 或 Qwen2.5 72B Q4 量化。

已验证技术栈

2× RTX 3090 24G · llama.cpp CUDA · --tensor-split · 70B Q4_K_M

最近验证 2026-07-22

70BMulti-GPUllama.cpptensor-split

张量切分

用 --tensor-split 将层分布到多卡。Q4_K_M 70B 权重约 44GB,48GB 总量勉强可行。

bash
./build/bin/llama-server \
  -m ./models/Llama-3.1-70B-Q4_K_M.gguf \
  --tensor-split 24,24 \
  -c 4096 -ngl 99 \
  --host 0.0.0.0 --port 8080

接下来

本文涉及的模型

相关指南

部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。