Llama 3.2 90B Vision Instruct
90BMeta Llama 3.2
旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。
专业 GPU
131K
最大上下文
2
量化变体
GGUF Q4_K_M
最佳质量
97.2%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Llama 3.2 对比11B
Llama 3.2 11B Vision Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
9.5 GB最低显存·99.5%精度
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
3B
Llama 3.2 3B Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
2.0 GB最低显存·99.8%精度
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
1B
Llama 3.2 1B Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
1.0 GB最低显存·99.5%精度
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
109B MoE
Llama 4 Scout 17B (16E)
Meta Llama 4
专业 GPU
55.0 GB最低显存·97.6%精度
Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。