Llama 3.2 11B Vision Instruct
11BMeta Llama 3.2
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
131K
最大上下文
2
量化变体
GGUF Q8_0
最佳质量
99.5%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站跑过 · 估算 = 本站未跑过:推算所得,或本站未核实的数字 · 社区 = 公开报告
相似模型
与 Llama 3.2 对比Llama 3.2 3B Instruct
Meta Llama 3.2
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
Llama 3.2 1B Instruct
Meta Llama 3.2
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
Llama 3.2 90B Vision Instruct
Meta Llama 3.2
旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。
Gemma 3 12B IT
Google Gemma 3
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。
在本地运行 Llama 3.2 11B Vision Instruct
在 Q4_K_M、4K 上下文下,Llama 3.2 11B Vision Instruct 约需 7.7 GB —— 权重 6.3 GB、KV 缓存 0.63 GB、激活缓冲 0.7 GB。本索引中能宽裕跑它的最小规格是 10 GB 显卡 —— 共 2 张,Arc B570 10G 起步;76 张卡中有 65 张可以。这些是计算值而非实测值:估算把「宽裕」的界线画在显存的 88%,大致就是桌面环境需要留出的余量。
上下文变长会多花多少
从 4K 提到 32K 约多占 4.37 GB,总量来到 12.5 GB。权重不随上下文变化,只有 KV 缓存会,而且是线性增长 —— 规划长文档场景时要盯的就是这个数字。该模型的原生上下文是 128K;在 Q4_K_M 下把它全部撑满约需 29 GB。
该下载哪个版本
本索引只收录了 Llama 3.2 11B Vision Instruct 的 GGUF 格式,共 2 个档位(Q4_K_M、Q8_0)。 其中 Q8_0 的公开困惑度损失最低,为 0.5%。列出的最快档位是 Q4_K_M,在 RTX 4090、batch 1 下约 88 tok/s —— 这是估算值,不是本站硬件上的实测。GGUF 可在 NVIDIA、AMD 与苹果芯片上通过 llama.cpp 和 Ollama 运行;AWQ 与 GPTQ 面向 CUDA 和 ROCm 上的 vLLM;EXL2 是 ExLlamaV2 —— 仅限 CUDA,而且已经归档,适合本机使用而不适合提供服务。
常见问题
- Llama 3.2 11B Vision Instruct 需要多少显存?
- 在 Q4_K_M、4K 上下文、batch 1 下约 7.7 GB,到 32K 时约 12.5 GB。这个数字是权重加 KV 缓存再加 10% 激活缓冲,由模型架构计算得出,不是在显卡上实测的。
- Llama 3.2 11B Vision Instruct 能在 10GB 显卡上跑吗?
- 可以 —— 在 Q4_K_M、4K 上下文下约需 7.7 GB,在 Arc B570 10G 上还剩 2.3 GB,本索引中 2 张 10 GB 显卡都一样。这是能宽裕跑它的最小规格;76 张中有 65 张可以。
- Llama 3.2 11B Vision Instruct 该用哪个量化档位?
- Q8_0 的公开质量损失最低(0.5%),而 Q4_K_M 是多数人实际使用的档位。索引中的 2 个档位是 Q4_K_M、Q8_0。
这个模型能跑在哪
按 Q4_K_M、4K 上下文估算,显存从小到大排列。「从容」指估算占用不超过显存的 88%。
怎么把它跑起来
针对本模型及同类硬件的部署指南。
本页数字会随模型数据或运行时版本的变化而更新。最近更新 2026-10-06 RSS → /zh/feed.xml