Llama 3.2 90B Vision Instruct
90BMeta Llama 3.2
旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。
131K
最大上下文
2
量化变体
GGUF Q4_K_M
最佳质量
97.2%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站跑过 · 估算 = 本站未跑过:推算所得,或本站未核实的数字 · 社区 = 公开报告
相似模型
与 Llama 3.2 对比Llama 3.2 11B Vision Instruct
Meta Llama 3.2
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
Llama 3.2 3B Instruct
Meta Llama 3.2
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
Llama 3.2 1B Instruct
Meta Llama 3.2
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
Llama 4 Scout 17B (16E)
Meta Llama 4
Meta Llama 4 Scout MoE(激活 17B / 总 109B),多模态,Q4_K_M 约需 68GB 显存。
在本地运行 Llama 3.2 90B Vision Instruct
在 Q4_K_M、4K 上下文下,Llama 3.2 90B Vision Instruct 约需 57.5 GB —— 权重 51.0 GB、KV 缓存 1.25 GB、激活缓冲 5.2 GB。本索引中能宽裕跑它的最小规格是 80 GB 显卡 —— 共 2 张,A100 80G 起步;76 张卡中有 11 张可以。这些是计算值而非实测值:估算把「宽裕」的界线画在显存的 88%,大致就是桌面环境需要留出的余量。
上下文变长会多花多少
从 4K 提到 32K 约多占 8.75 GB,总量来到 67.1 GB。权重不随上下文变化,只有 KV 缓存会,而且是线性增长 —— 规划长文档场景时要盯的就是这个数字。该模型的原生上下文是 128K;在 Q4_K_M 下把它全部撑满约需 100 GB。
该下载哪个版本
本索引只收录了 Llama 3.2 90B Vision Instruct 的 GGUF 格式,共 2 个档位(Q4_K_M、Q3_K_M)。 其中 Q4_K_M 的公开困惑度损失最低,为 2.8%。本站硬件上没有该模型的吞吐实测数据。GGUF 可在 NVIDIA、AMD 与苹果芯片上通过 llama.cpp 和 Ollama 运行;AWQ 与 GPTQ 面向 CUDA 和 ROCm 上的 vLLM;EXL2 是 ExLlamaV2 —— 仅限 CUDA,而且已经归档,适合本机使用而不适合提供服务。
常见问题
- Llama 3.2 90B Vision Instruct 需要多少显存?
- 在 Q4_K_M、4K 上下文、batch 1 下约 57.5 GB,到 32K 时约 67.1 GB。这个数字是权重加 KV 缓存再加 10% 激活缓冲,由模型架构计算得出,不是在显卡上实测的。
- Llama 3.2 90B Vision Instruct 能在 80GB 显卡上跑吗?
- 可以 —— 在 Q4_K_M、4K 上下文下约需 57.5 GB,在 A100 80G 上还剩 22.5 GB,本索引中 2 张 80 GB 显卡都一样。这是能宽裕跑它的最小规格;76 张中有 11 张可以。
- Llama 3.2 90B Vision Instruct 该用哪个量化档位?
- Q4_K_M 的公开质量损失最低(2.8%),而 Q4_K_M 是多数人实际使用的档位。索引中的 2 个档位是 Q4_K_M、Q3_K_M。
这个模型能跑在哪
按 Q4_K_M、4K 上下文估算,显存从小到大排列。「从容」指估算占用不超过显存的 88%。
怎么把它跑起来
针对本模型及同类硬件的部署指南。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-06 RSS → /zh/feed.xml