EXL2 详解
EXL2 是什么、哪些运行时能读它、显存开销如何,以及本索引 81 个模型中提供该格式的全部 21 个。
EXL2 是什么
ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。 本索引的 81 个模型中有 21 个提供该格式,共 2 个量化档位 —— 4.65bpw、3.5bpw。
什么运行时能读它
ExLlamaV2 · TabbyAPI。硬件要求:NVIDIA GPU (Ampere+ recommended)。最擅长的场景:单卡极致性能。强项:GPU 推理速度最快;每比特精度最优;超低 2bpw 选项。短板:仅限 NVIDIA;学习曲线较陡。
它要多少显存
Llama 3.1 8B Instruct 在 EXL2 4.65bpw 下为每权重 4.65 比特,折合权重 4.4 GB,加上 4K 上下文的 KV 缓存 0.5 GB 与激活缓冲 0.5 GB —— 合计 5.4 GB;本索引中能从容装下它的最小显卡是 RTX 5060 Ti 8G(8 GB)。 在本站有该档位公开困惑度数据的 15 个模型中,相对 FP16 的损失中位数为 2.2%。
本索引收录的 EXL2 档位
| 档位 | 每权重比特 | 模型数 | 损失中位数 |
|---|---|---|---|
| 4.65bpw | 4.65 | 15 | 2.2%15 个样本的中位数 |
| 3.5bpw | 3.5 | 6 | 4.8%6 个样本的中位数 |
每权重比特取自模型自己的数据行,因此出现区间说明不同模型在同一档位下的实际大小略有差异。损失中位数只统计该档位有公开困惑度数据的模型,样本量标在旁边。
本索引中提供 EXL2 的模型
81 个中的 21 个,按参数量从大到小排列,各自标出最小的 EXL2 档位,以及该档位已公开的困惑度损失(若有)。
- Qwen2.5 72B Instruct72B · 3.5bpw · 4.8%
- Llama 3.1 70B Instruct70B · 3.5bpw · 5.2%
- Qwen3 32B Instruct32B · 3.5bpw · 4.5%
- Qwen2.5 32B Instruct32B · 3.5bpw · 4.8%
- Qwen2.5-Coder 32B Instruct32B · 3.5bpw · 4.5%
- DeepSeek-R1-Distill-Qwen-32B32B · 3.5bpw · 4.5%
- Mistral Small 24B Instruct24B · 4.65bpw · 2.2%
- Devstral Small 1.1 24B24B · 4.65bpw · 2.5%
- Magistral Small 1.2 24B24B · 4.65bpw · 2.5%
- Qwen3 14B Instruct14B · 4.65bpw · 1.8%
- Qwen2.5 14B Instruct14B · 4.65bpw · 2.1%
- DeepSeek-R1-Distill-Qwen-14B14B · 4.65bpw · 2.0%
- Qwen3 8B Instruct8B · 4.65bpw · 2.0%
- Llama 3.1 8B Instruct8B · 4.65bpw · 2.5%
- Nous Hermes 3 Llama 3.1 8B8B · 4.65bpw · 2.3%
- OpenChat 3.6 8B8B · 4.65bpw · 2.4%
- DeepSeek-R1-Distill-Llama-8B8B · 4.65bpw · 1.9%
- Qwen2.5 7B Instruct7B · 4.65bpw · 2.2%
- Qwen2.5-Coder 7B Instruct7B · 4.65bpw · 2.0%
- DeepSeek-R1-Distill-Qwen-7B7B · 4.65bpw · 2.2%
- Qwen3 4B Instruct4B · 4.65bpw · 2.1%
常见问题
EXL2 是什么?
ExLlamaV2 格式,每层独立混合精度量化,每比特精度最优,单 GPU 推理速度最快。 它由 ExLlamaV2 · TabbyAPI 读取,硬件要求为 NVIDIA GPU (Ampere+ recommended),本索引 81 个模型中有 21 个提供该格式。
Llama 3.1 8B Instruct 用 EXL2 需要多少显存?
在 EXL2 4.65bpw、4K 上下文下约 5.4 GB,其中权重本身占 4.4 GB,因此 8 GB 的显卡可以从容运行。上下文更长会额外增加 KV 缓存;计算器可以算任意组合。
EXL2 该下载哪个档位?
本索引收录了 4.65bpw(15 个模型)、3.5bpw(6 个模型)。4.65bpw 是最多模型提供的档位,通常也是起点。最小的是 3.5bpw(3.5 bpw),最大的是 4.65bpw(4.65 bpw)—— 真正的原则是:在显卡仍有余量的前提下取最高档位,而不是取「能加载的最小档位」。
该用 EXL2 还是别的格式?
取决于你用什么来跑:这个格式的位置是「单卡极致性能」。本站把它与 GGUF、AWQ 做了直接对比,且只用同时提供两种格式的模型 —— 只有那里的对比是可测量的,而不是编辑观点。