Llama 3.2 11B Vision Instruct
11BMeta Llama 3.2
多模态 Llama,支持图像理解。视觉编码器额外增加约 2GB 显存开销。
消费级显卡Mac / 苹果芯片
131K
最大上下文
2
量化变体
GGUF Q8_0
最佳质量
99.5%
精度保留率
量化变体对比
各量化级别的显存、质量损失及 RTX 4090 推理速度
实测 = 本站基准 · 估算 = 公式推算 · 社区 = 公开报告
相似模型
与 Llama 3.2 对比3B
Llama 3.2 3B Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
2.0 GB最低显存·99.8%精度
小巧而实用,4GB 显存或 8GB 内存即可运行,甚至可在手机端通过 llama.cpp 运行。
1B
Llama 3.2 1B Instruct
Meta Llama 3.2
消费级显卡Mac / 苹果芯片
1.0 GB最低显存·99.5%精度
超轻量 Llama,适合移动端和嵌入式,Q4 量化仅需不到 2GB 显存。
90B
Llama 3.2 90B Vision Instruct
Meta Llama 3.2
专业 GPU
44.2 GB最低显存·97.2%精度
旗舰多模态 Llama,需双 4090 或 A100;视觉模块额外约 3GB 显存。
12B
Gemma 3 12B IT
Google Gemma 3
消费级显卡Mac / 苹果芯片
8.0 GB最低显存·98.7%精度
中型 Gemma 3 视觉模型,Q4 可装入 16GB,多语言对话表现优秀。