quantized
.uk
首页
模型库
基准测试
部署指南
工具
我的显卡
RTX 4090 (24G)
RTX 4080 Super (16G)
RTX 4070 Ti Super (16G)
RTX 4070 Ti (12G)
RTX 4070 Super (12G)
RTX 4070 (12G)
RTX 4060 Ti 16G (16G)
RTX 4060 Ti 8G (8G)
RTX 4060 (8G)
RTX 3090 (24G)
RTX 3080 Ti (12G)
RTX 3080 12G (12G)
RTX 3080 10G (10G)
RTX 3070 Ti (8G)
RTX 3070 (8G)
A100 80G (80G)
A100 40G (40G)
L40S 48G (48G)
A40 48G (48G)
H100 80G (80G)
Mac M3 Ultra 192G (192G)
Mac M3 Max 128G (128G)
Mac M3 Max 48G (48G)
Mac M3 Pro 36G (36G)
Mac M3 Pro 18G (18G)
Mac M3 16G (16G)
Mac M3 8G (8G)
Mac M2 Ultra 192G (192G)
Mac M2 Max 96G (96G)
Radeon RX 7900 XTX (24G)
Radeon RX 7900 XT (20G)
Radeon RX 7900 GRE (16G)
Radeon RX 7800 XT (16G)
Radeon RX 7700 XT (12G)
Radeon RX 6900 XT (16G)
Radeon RX 6800 XT (16G)
Radeon RX 6700 XT (12G)
Radeon PRO W7900 48G (48G)
Instinct MI100 32G (32G)
128 GB RAM (CPU) (128G)
64 GB RAM (CPU) (64G)
32 GB RAM (CPU) (32G)
16 GB RAM (CPU) (16G)
EN
首页
脚本生成器
$ 脚本生成器
CLI 脚本生成器
秒生成即开即用的启动命令,告别背参数
推理框架
llama.cpp
Ollama
vLLM
ExLlamaV2
运行环境
Linux / Ubuntu
macOS 终端
Docker
Docker Compose
模型
选择模型...
Llama 3.1 8B Instruct (8B)
Llama 3.1 70B Instruct (70B)
Llama 3.2 3B Instruct (3B)
Qwen2.5 7B Instruct (7B)
Qwen2.5 14B Instruct (14B)
Qwen2.5 32B Instruct (32B)
DeepSeek-Coder-V2-Lite Instruct (16B)
Phi-3.5 Mini Instruct (3.8B)
Mistral Nemo 12B Instruct (12B)
Gemma 2 9B Instruct (9B)
Qwen2.5 72B Instruct (72B)
DeepSeek-R1-Distill-Qwen-14B (14B)
Llama 3.3 70B Instruct (70B)
Mistral Small 24B Instruct (24B)
Qwen2.5-Coder 32B Instruct (32B)
Qwen2.5-Coder 7B Instruct (7B)
Qwen2.5 3B Instruct (3B)
Llama 3.2 1B Instruct (1B)
DeepSeek-R1-Distill-Llama-70B (70B)
Codestral 22B (22B)
Mixtral 8x7B Instruct (47B MoE)
Command R 35B (35B)
Yi 1.5 34B Chat (34B)
Solar 10.7B Instruct (11B)
StarCoder2 15B (15B)
Llama 3.2 11B Vision Instruct (11B)
Qwen2-VL 7B Instruct (7B)
Nous Hermes 3 Llama 3.1 8B (8B)
WizardLM-2 7B (7B)
Granite 3.1 8B Instruct (8B)
Gemma 2 2B Instruct (2B)
Gemma 2 27B Instruct (27B)
Qwen2.5 0.5B Instruct (0.5B)
Qwen2.5 1.5B Instruct (1.5B)
Phi-3 Medium 14B Instruct (14B)
Phi-4 Mini Instruct (3.8B)
Mistral 7B Instruct v0.3 (7B)
DeepSeek-V2-Lite Chat (16B)
DeepSeek-R1-Distill-Qwen-7B (7B)
DeepSeek-R1-Distill-Qwen-32B (32B)
Llama 3.2 90B Vision Instruct (90B)
OLMo 2 7B Instruct (7B)
InternLM2 7B Chat (7B)
InternLM2 20B Chat (20B)
Aya 23 8B (8B)
OpenChat 3.6 8B (8B)
Zephyr 7B Beta (7B)
Stable LM 2 12B Chat (12B)
Falcon 3 10B Instruct (10B)
Jamba 1.5 Mini (12B)
DBRX Instruct (132B)
Qwen3 8B Instruct (8B)
Qwen3 14B Instruct (14B)
Gemma 3 4B IT (4B)
Gemma 3 12B IT (12B)
Llama 4 Scout 17B (16E) (109B MoE)
Llama 4 Maverick 17B (128E) (400B MoE)
Llama 3.1 405B Instruct (405B)
Qwen3 32B Instruct (32B)
Qwen3 30B-A3B Instruct (30B-A3B)
Qwen3 235B-A22B Instruct (235B-A22B)
DeepSeek-V3 (671B MoE)
DeepSeek-R1 (671B MoE)
Qwen3 4B Instruct (4B)
Qwen3-Coder 30B-A3B Instruct (30B-A3B)
Mistral Large 3 675B Instruct (675B MoE)
GLM-4-9B-Chat (9B)
Gemma 3 27B IT (27B)
DeepSeek-R1-Distill-Llama-8B (8B)
Phi-4 14B (14B)
Qwen3 1.7B Instruct (1.7B)
GPT-OSS 20B (21B MoE)
GPT-OSS 120B (117B MoE)
GLM-4.5-Air (106B MoE)
Devstral Small 1.1 24B (24B)
Qwen3-VL 8B Instruct (8B)
Qwen3-VL 30B-A3B Instruct (30B-A3B)
Magistral Small 1.2 24B (24B)
Seed-OSS 36B Instruct (36B)
量化级别
Q4_K_M
Q4_K_S
Q6_K
Q8_0
AWQ INT4
EXL2 4.65bpw
运行参数
GPU 层数 (n_gpu_layers)
上下文长度
CPU 线程数
服务端口
运行参数 — API Key (optional)
请先在上方选择框架、环境和模型