quantized
.uk
Home
Quant Hub
Benchmarks
Cookbook
Tools
My GPU
RTX 4090 (24G)
RTX 4080 Super (16G)
RTX 4070 Ti Super (16G)
RTX 4070 Ti (12G)
RTX 4070 Super (12G)
RTX 4070 (12G)
RTX 4060 Ti 16G (16G)
RTX 4060 Ti 8G (8G)
RTX 4060 (8G)
RTX 3090 (24G)
RTX 3080 Ti (12G)
RTX 3080 12G (12G)
RTX 3080 10G (10G)
RTX 3070 Ti (8G)
RTX 3070 (8G)
A100 80G (80G)
A100 40G (40G)
L40S 48G (48G)
A40 48G (48G)
H100 80G (80G)
Mac M3 Ultra 192G (192G)
Mac M3 Max 128G (128G)
Mac M3 Max 48G (48G)
Mac M3 Pro 36G (36G)
Mac M3 Pro 18G (18G)
Mac M3 16G (16G)
Mac M3 8G (8G)
Mac M2 Ultra 192G (192G)
Mac M2 Max 96G (96G)
Radeon RX 7900 XTX (24G)
Radeon RX 7900 XT (20G)
Radeon RX 7900 GRE (16G)
Radeon RX 7800 XT (16G)
Radeon RX 7700 XT (12G)
Radeon RX 6900 XT (16G)
Radeon RX 6800 XT (16G)
Radeon RX 6700 XT (12G)
Radeon PRO W7900 48G (48G)
Instinct MI100 32G (32G)
128 GB RAM (CPU) (128G)
64 GB RAM (CPU) (64G)
32 GB RAM (CPU) (32G)
16 GB RAM (CPU) (16G)
中文
Home
All comparisons
Quantization format comparisons
Side-by-side on the formats this index actually ships, with the models that carry both.
GGUF
vs
AWQ
79 · 53 · ⇄ 53
GGUF
vs
EXL2
79 · 21 · ⇄ 21
GGUF
vs
GPTQ
79 · 4 · ⇄ 4
AWQ
vs
EXL2
53 · 21 · ⇄ 16
AWQ
vs
GPTQ
53 · 4 · ⇄ 0
EXL2
vs
GPTQ
21 · 4 · ⇄ 0