$ 脚本生成器

CLI 脚本生成器

秒生成即开即用的启动命令,告别背参数

运行参数

请先在上方选择框架、环境和模型

命令里的标识符从哪来

模型的展示名不是标识符。"Llama 3.1 8B Instruct" 既不是 Hugging Face 仓库名,也不是 GGUF 文件名或 Ollama tag,用它拼出来的命令会以一种"看着本该能跑"的方式失败。生成器从站内的仓库映射取真实仓库,并据此推导 GGUF 文件名 —— 这才是实际的命名约定:bartowski/Meta-Llama-3.1-8B-Instruct-GGUF 提供的文件是 Meta-Llama-3.1-8B-Instruct-Q4_K_M.gguf。

为什么有些命令里是占位符

vLLM 加载的是 FP16、AWQ 或 GPTQ 权重,而非本站映射的 GGUF 仓库;EXL2 转换则由不同的人按模型分别发布。这两者都无法从索引已知的信息推导出来,所以相应命令给出显式的 <hf-repo-id> 占位符,而不是一个貌似合理的猜测。明显的占位符只让你多查一次;错误的仓库名会让你白下一次并撞上一个费解的报错。

会静默失效的编译参数

llama.cpp 把 CMake 选项从 LLAMA_* 改名为 GGML_*。CMake 遇到未知选项不会报错 —— 它只是定义一个没人用的变量然后继续 —— 所以 -DLLAMA_CUDA=ON 会编出一个能编译、能运行、但纯 CPU 的版本。如果你的构建莫名很慢,先检查参数名。本页生成的命令使用的是当前名称。

常见问题

为什么 Ollama 用 hf.co/ 而不是短 tag?
Ollama 的库 tag(如 qwen2.5:7b)是人工策展的,无法从模型名推导 —— 猜出来的 tag 会直接 404。直接从 Hugging Face 拉取 GGUF 对所有已映射模型都有效,并且能精确指定量化档位。如果该模型有你更习惯的库 tag,也可以用,只是量化档位由它替你决定。
-ngl 是什么,该设多少?
卸载到 GPU 的 transformer 层数。99 表示"全部",只要模型装得下就该用这个值。调低它可以把模型拆分在显存和内存之间;但只要有任何一层落在内存里,吞吐就会明显下降 —— 所以先用显存计算器看看是否真有必要。
下载命令一个文件都没匹配到,为什么?
huggingface-cli download --include 在模式匹配不到任何文件时退出码仍是 0,所以文件名写错看起来就像"成功下载了零个文件"。请确认该仓库确实发布了这个量化档位 —— 小模型常常没有 Q8_0,而超大模型的文件是分片的,名字带 -00001-of-0000N 后缀。
这些命令能在 AMD 或苹果芯片上跑吗?
llama.cpp 和 Ollama 可以 —— 选择对应环境后编译参数会切换为 Metal 或 ROCm。ExLlamaV2 仅支持 CUDA。 vLLM 并非如此:它提供官方 ROCm 构建,可在受支持的 Radeon 与 Instinct 卡上运行,只是 AWQ/GPTQ 算子在该平台的覆盖比 CUDA 窄且随版本变动 —— 选定前请查阅 vLLM 安装文档确认你的卡。两者都不支持苹果芯片。