HF 转 GGUF
先将 safetensors 模型转为 FP16 GGUF,再量化。
bash
python convert_hf_to_gguf.py ./my-model --outfile my-model-f16.gguf
./build/bin/llama-quantize my-model-f16.gguf my-model-Q4_K_M.gguf Q4_K_M相关指南
入门端侧 / 本地9 分钟阅读
Windows + CUDA 运行 llama.cpp
Windows 11 上编译带 NVIDIA GPU 支持的 llama.cpp — PC 玩家的最简路径。
进阶端侧 / 本地9 分钟阅读
本地运行 GPT-OSS 20B(及 120B)——不要重新量化
GPT-OSS 原生就是 MXFP4,习惯性去下 Q4_K_M 反而更大更差。本文讲清显存怎么算、该用哪些参数,以及如何用 MoE 专家卸载在 24GB 卡上跑 120B。
高级端侧 / 本地11 分钟阅读
双 RTX 3090 运行 70B(llama.cpp)
双 24GB 卡张量切分,运行 Llama 3.1 70B 或 Qwen2.5 72B Q4 量化。
部署指南仅供学习参考。每个模型均有独立许可协议 — 下载或部署前请阅读 Hugging Face 官方模型卡。