Qwen3 8B Instruct

8B

Alibaba Qwen3

Latest Qwen3 dense 8B with thinking mode. Strong upgrade from Qwen2.5 7B for local deploy.

217.4K HF downloads240 likesQwen/Qwen3-8B-GGUF· stats from 8/8/2026
Consumer GPUMac / Apple SiliconCPU / VPS

41K

Max Context

4

Quant Variants

GGUF Q6_K

Best Quality

99.4%

Accuracy Retained

Quantization Variants

Per-quant VRAM, quality loss, and inference speed on RTX 4090

Measured = site benchmarks · Estimated = formula · Community = public reports

FormatLevelBPWVRAMPPL LossSpeedSourceActions
GGUFQ4_K_M4.855.8 GB2.8%142 tok/sMeasured
CalcHF
GGUFQ6_K6.567.5 GB0.6%122 tok/sMeasured
CalcHF
AWQINT445.1 GB3.8%205 tok/sMeasured
CalcHF
EXL24.65bpw4.655.5 GB2.0%228 tok/sMeasured
CalcHF

Similar models

Compare with Qwen3 4B