数据更新日志

共 61 条记录,最新的在前。

最后更新 2026-09-11

RSS
  1. 2026-09-11本站终于开始回答「我该跑哪个」,而不只是「哪些装得下」。显卡页给你一份清单,Hub 给你另一份清单,但搜「16G 显卡最好的模型」的人要的不是清单,是一个推荐。现在有七个页面,从 8G 到 32G 每个显存档位一个,外加 Apple 芯片,各自给出通用、写代码、图像三种用途下该跑的模型,附显存占用、剩余余量和已公开的质量损失。这些推荐全部由索引算出,用的是首页 hero 背后的同一个函数 —— 所以档位页和首页不可能对同一张卡给出不同推荐,而新增一个模型会让七个页面同时更新,无需改动任何一行文案。每页还会点名**装不下**的那个最接近的模型以及差多少,因为「边界在哪」正是清单从来不会告诉你的那一半
  2. 2026-09-11模型搜索框现在是真正的搜索框了。全站每个页面都声明了 /quant-hub/?q=… 这个搜索接口,而这个网址确实能正确筛选 —— 但产生它的那个控件是一个没有 name、也没有表单包裹的输入框,所以没有 JavaScript 就无法提交,读取页面代码的程序也发现不了这个接口。现在它是一个规范的搜索表单,按下回车就会得到站点一直在对外声明的那个网址。搜索也不再在最常见的词上失灵:此前输入「coding」「vision」「gguf」「7b」都是零结果,因为搜索只看模型名 —— 现在它覆盖参数量、用途、硬件和格式,也知道人们打的是「coding」而数据里写的是「code」。搜索无结果时会给出四个来自索引、点了一定有结果的建议,而不是一片空白;带筛选参数的网址会声明不要被收录但仍可被抓取,这样一条可分享的筛选链接不会变成成千上万个近乎重复的页面
  3. 2026-09-11现在有了常见问题页,而且每个答案都是算出来的,不是写出来的。「7B 要多少显存」这个问题,本站一直有计算器,却没有答案 —— 现在围绕体积与显存、量化掉点、格式与运行时、硬件、数据来源五个主题的 24 个问题,全部由同一份索引作答,每条末尾都带一个可以自己核对的站内链接。因为是算出来的,它们不会像当初的指南那样与计算器脱节:改动一行模型数据,依赖它的答案就会跟着变。有三个索引确实回答不了的问题 —— 量化对写代码的影响是否更大、官方 QAT 是否优于社区量化、以及只公布了单一档位数据的模型上 Q5 比 Q4 值不值 —— 页面会直说,而不是猜一个
  4. 2026-09-11本索引收录的每种格式现在都有了自己的页面。「AWQ 是什么」此前在一个以量化命名的站点上无处可落 —— 有格式之间的两两对比,却没有一个页面单纯讲清楚一种格式,而提供 AWQ 的 53 个模型也没有共同的归属页。GGUF、AWQ、EXL2、GPTQ 现在各有:这个格式是什么、哪些运行时能读它、一个真实模型在 4K 下要多少显存、本索引实际收录了哪些量化档位及其公开损失中位数,以及提供该格式的全部模型 —— 从格式指向模型的新增内链共 159 条。MXFP4 放在 GGUF 页面里讲,而没有被单列为第五种格式,因为它本来就是这样:GPT-OSS 的原生 4-bit 权重是以 GGUF 文件分发的,不是另一种容器
  5. 2026-09-11两个无从比起的对比页已经下线。「AWQ vs GPTQ」与「EXL2 vs GPTQ」的交集恰好为零 —— 本站 81 个模型中没有任何一个同时提供这两种格式 —— 所以这两个页面连一行「同一份权重的两种格式」都摆不出来,只能用约 650 词把两段说明并排放着。现在,没有共同模型的格式组合根本不会生成页面;这个问题改由 GGUF vs GPTQ 页面回答,它直白地说明了没有人会为同一个模型在 GPTQ 与 AWQ 之间做选择,以及该用什么替代。旧网址会永久重定向到那里,而不是变成 404
  6. 2026-09-11硬件页现在真的在讲硬件。此前 61 个页面只是换了名字的同一个页面 —— 因为能装下什么完全由显存决定,每张 16 GB 的卡返回的清单一模一样。现在每页开头都会给出该卡的显存带宽、能装下的最大模型、一个留有余量的选择,以及一个由规格推算出的速度上限:生成一个 token 就要把每个权重读一遍,所以 8B 的 Q4_K_M 在 288 GB/s 的 RTX 4060 Ti 上约 62 tok/s 封顶,在 736 GB/s 的 RTX 4080 Super 上约 159 —— 同样 16 GB、同样的模型,却是两台很不一样的机器。这个上限是公开数字的算术结果,不是跑分,页面上也如实说明。做这个算术的同时还发现本站自己有三条基准数据,其速度是所标显卡在物理上达不到的;这些行已被删除,而不是调整数值
  7. 2026-09-11格式页终于有内容了。此前它只有 65 词 —— 一个以量化命名的站点上最单薄的页面,却是六个格式对比页唯一的入口。现在页面开头是一张由索引统计出来的表:81 个模型中有多少个提供该格式、4-bit 档位已公布困惑度损失的中位数及其样本量,以及本索引实际收录的量化档位。HQQ 在表中显示为 0 / 81,并附有说明 —— 它作为参考资料收录,Hub 里找不到它。没有公开困惑度数据的格式显示为短横线,而不是估算值
  8. 2026-09-11模型页现在会自己讲清楚。此前 81 个页面几乎只有表格 —— 约 220 词,人扫一眼看不出「我的卡跑不跑得动」,AI 助手也无从引用。现在每页都有三段简短说明和三个由该模型自身数字回答的问题:4K 下要多少显存、上下文变长会多花多少、该下载哪个版本。这些文字全部由数据生成,因此不会与数据脱节 —— 混合注意力的模型得到的文案与常规模型明显不同。部署指南也开始声明最近一次修改时间,以及它们实际讲的是哪些模型和硬件
  9. 2026-09-11硬件数据库更新到当代。Blackwell(RTX 5090 到 5060)、RDNA 4(RX 9070 XT 与 9070),以及 M4、M5 系列 Mac(含 256GB 与 512GB 的 Mac Studio 配置)现在都有了独立页面,共 18 张卡。在今天之前,站内最新的 NVIDIA 消费级显卡还是 2022 年的 RTX 4090 —— 而「RTX 5090 能跑什么」恰恰是本站存在的理由。这些卡都没有在本站实测过,每个页面都会如实说明,而不是让估算值看起来像实测值
  10. 2026-09-11可发现性与标签诚实度。每个硬件页面的描述现在会写明具体显卡和它能跑的最大模型 —— 此前 43 个页面中有 36 个只共用九条描述,因为模板里只有显存大小这一个变量。工具索引与数据更新日志从 404 变成了真实页面,导航里终于有了 43 个硬件页和格式对比的入口,首页也不再把同一条更新印三遍。模型数量改为从索引实时计算,而不是在六个地方手写;NEW 徽章旁的日期现在标注为「收录」—— 那是本索引收录它的时间,不是模型的发布时间
  11. 2026-09-11计算器现在知道 2026 年的模型并非都用同一种方式缓存注意力,首批两个模型也已入库。Qwen3.8 27B 的 64 层里只有 16 层是全注意力、其余保留固定大小的循环状态,旧算法把它的 KV 缓存高估了四倍 —— 在 32K 上下文下算出 8GB,而实测是 2GB。现在按模型真实的注意力结构计算,并与 8K、32K、262K 三个公开实测值吻合。同批加入的还有 Ministral 3 8B,其体积来自 Mistral 官方发布的 GGUF。凡是没有人公布过逐档质量损失的,该列现在显示一个破折号,而不是一个数字
  12. 2026-09-11修掉两处抓取层面的缺陷。凡是名字里带版本号的模型 —— llama-3.1-8b、qwen2.5-7b、phi-3.5-mini —— 指向它们的站内链接都会丢掉尾部斜杠并触发跳转:涉及 46 个 URL、2,101 条链接,其中 27 个模型页在自己的规范地址上没有任何直接内链。另外语言切换器是按钮而不是链接,导致 164 个中文页面在全站没有任何可抓取的入口。两处现在都由构建检查把关,不会再悄悄回退
  13. 2026-09-08搜索与反馈的基础工作。硬件页面现在会说明这张卡是否有真实实测记录(43 张里有 4 张),并列出显存预算相同的其他显卡 —— 因为能跑哪些模型由显存决定,否则这些页面彼此几乎是副本。结构化数据此前在只列出 30 个模型的页面上声称有 73 个;现在全部 329 个页面都与页面实际内容一致。另外,指南和命令生成器会问你「它真的跑起来了吗」:复制命令不等于它能用;而勘误邮件在打开你的邮件应用之前,会先把要发送的原文完整展示给你
  14. 2026-09-08两处修复,来自实际跑验证矩阵而不是读代码。在显存计算器里切换模型时会保留上一个模型的量化档位 —— 选中 Llama 3.1 8B 的 EXL2 再切到 GPT-OSS 20B,它会一本正经地给出一个并不存在的文件的体积;现在档位会自动切到该模型确实提供的一档,而索引中没有对应构建的档位会被标注为「仅为通用表估算」。另外计算器在正向模式下会把显卡从自己的地址栏里删掉,导致分享出去的链接丢失了这个结论所针对的硬件
  15. 2026-09-08教程与可读性。8GB 入门指南的显存数字比本站计算器高出约 2GB,还告诉读者 14B「需要 36GB 以上」(实际 11GB)—— 该指南连同 Mac 与双卡指南已按索引重写,补上前置条件、如何确认模型真的跑在 GPU 上,以及装不下时该怎么办。阅读时长改为从正文推算而不再手写(23 篇里有 22 篇是虚构的);最近修改后未重新实机运行的指南改为标注「面向的技术栈」,不再声称验证日期;站内所有文字颜色现已达到 WCAG AA 对比度下限 —— 实测 3,175 个文本节点,无一不达标。图表在静态 HTML 中附带同数据的表格,筛选按钮会播报是否选中,上下文长度会标出精确 token 数
  16. 2026-09-08首页现在从你的硬件开始。选好显卡和用途,它会给出装得下的最大模型、留有余量的一个,以及实测最快的一个 —— 每个都附显存算法和进入计算器的链接。下方是常见显卡、真机基准的样本行,以及反馈数字错误的入口;格式热度与雷达图移到了格式页,完整更新日志仍在本页,默认折叠
  17. 2026-09-08工具之间现在会记住你的选择。在显存计算器里选好模型再去命令生成器,不必重新输入一遍 —— 模型、量化档位与上下文长度会带过去,而分享链接始终优先于你本地保存的配置。计算器还能直接跳到当前配置对应的命令;当模型装不进你的显卡时,它会说明该改什么、以及改完是多少
  18. 2026-09-08数字现在会交代自己的来源。对比工具此前有一行 "Q4_K_M 显存" 在切换上下文时纹丝不动,而旁边的说明却声称它会随之变化 —— 现在拆成会跟随控件的预估行和固定的已发布行,各自标注。6:1 "8B 胜出" 的比分已移除:它把内存算了两次、把本站收录了多少变体也算进去,还把参数更少当成优势
  19. 2026-09-08模型卡片不再拼接不同配置。统计行此前把某个档位的最低显存与另一个档位的最快速度并排展示,仿佛两者可以同时获得;现在统一为一套具名配置(Q4_K_M · RTX 4090 · batch 1)。显卡快捷筛选与硬件页的计数仍然不同 —— 4060 Ti 16G 上是 60 与 51 —— 但两者现在共用同一个函数,且各自说明了所用规则
  20. 2026-09-08生成命令的修正:本机 llama.cpp 服务改为绑定 127.0.0.1,不再把未鉴权的端点暴露在所有网卡上;下载步骤会先安装它所需的 CLI;此前"vLLM 仅支持 CUDA"的说法是错的 —— 它提供官方 ROCm 构建。中文首页的编辑推荐不再夹带英文,其 RSS 链接也指向页面头部早已声明的中文订阅源
  21. 2026-09-01新增:格式对比页。GGUF 与 AWQ、GGUF 与 EXL2 等六组,对比硬件支持、运行时与采用率,并列出同时发布两种格式权重的模型 —— 此时两行描述的是同一个模型,对比不再只是编辑判断。若没有模型同时提供两种格式,页面会如实说明,而不是含糊带过
  22. 2026-09-01计算器改为给结论,而不是罗列。硬件面板此前平铺 43 根柱子且大多为绿色 —— 占了大量篇幅却几乎没有回答问题。现在它先给出你真正想要的事实("43 张卡中 16 张可从容运行 —— 最小的是 Instinct MI100 32G"),如果你设置了自己的显卡还会单独给出裁决,完整列表则收在一次点击之后。三个工具里 79 项的模型下拉也改为按尺寸分组,不再按录入顺序排列
  23. 2026-09-01新增:每张显卡一个页面。数据库中全部 43 张卡都已覆盖 —— "RTX 4060 Ti 16G 能跑哪些大模型?"给出 79 个索引模型中的 51 个,各自取 4K 上下文下仍留有余量的最佳量化档位,并按尺寸分组。这些数据一直都在,只是此前仅作为筛选参数存在,从未成为页面。中英合计新增 88 个页面
  24. 2026-09-01四个工具页现在会自我说明。此前每页只有一个标题、没有任何正文 —— 一个孤立的交互控件,读者无从校准。现在它们分别说明显存估算如何得出、为何上下文长度主导结果、CLI 命令里的标识符从哪来、以及为什么有些命令是占位符,并各配一组常见问题,中英双语
  25. 2026-09-01推理速度图恢复可读:18 根柱子里有 13 根标签都是 "RTX 4090",屏幕上没有任何信息表明每根对应哪个模型。现在每根柱子都标注模型与硬件,并新增图例说明颜色含义(颜色一直代表推理框架,但此前从未说明)。手机端点击目标达到 44px 下限
  26. 2026-09-01首页的质量数字现在会说明自己描述的是哪一档:Q4_K_M 下保留 97.1%,取全部 79 个模型的中位数,并在旁标注 1.4–5.2% 的区间。旧的"98.4% 平均精度"是对每个模型各自最好的那一档求平均,因此往数据里补一个档位就会让它变动。中文版基准表格也已完整翻译 —— 此前备注列整列是英文
  27. 2026-09-01模型索引进入 HTML。此前 /quant-hub/ 完全由浏览器渲染,静态页面里没有任何标题、也没有 79 个模型名 —— 全站最核心的页面对搜索引擎和无 JavaScript 环境等于空白。现在 79 张卡片直接写入 HTML,筛选在其之上叠加
  28. 2026-09-01显存计算器不再回答你没问的问题:此前未选模型时会回落到通用 7B,给出 4.98 GB 并对全部 43 张显卡打绿灯。中文读者现在有独立的 /zh/feed.xml 订阅源,每个页面都声明了自己的 feed,/rss.xml 也不再 404
  29. 2026-09-01首页无需等待 JavaScript 即可绘制:此前标题以 opacity:0 发出,要等 bundle 加载后才可见,导致预渲染站点的真实用户 LCP P75 达 3.1 秒。入场动画改为纯 CSS,framer-motion 已移除 —— 首屏 JavaScript 减少 33 kB
  30. 2026-08-23格式相关的展示与索引对齐:首页徽章、"格式追踪"统计与 Hub 筛选均改为从实际有模型的格式推导(4 种)。HQQ 仍保留在格式科普中作为参考,但不再引导到没有结果的浏览路径
  31. 2026-08-23格式向导:量化档位改为按格式区分 —— 此前选择"最易上手"会给出 EXL2 · Q4_K_M、AWQ · Q4_K_M 这类两种格式里都不存在的档位。框架推荐也改为跟随格式,AMD 读者不会再看到 EXL2 配 ROCm 运行时,却在旁边读到"EXL2 无法在 ROCm 上运行"
  32. 2026-08-23首页排版:统计条自 job path 卡片引入后就一直盖在卡片上,遮住全部三行说明;Hero 在手机上被裁切,显存计算器按钮与格式徽章有一部分点不到。导航栏在平板宽度下不再溢出
  33. 2026-08-20CLI 生成器现在给出真能跑的命令:用真实 GGUF 仓库与文件名替代占位符,Ollama 改用 `ollama run hf.co/…`(原先生成的 tag 会 404),vLLM 传仓库 id 而非模型展示名。llama.cpp 编译参数改为 GGML_* 新命名(旧的 LLAMA_* 会被忽略,静默编出纯 CPU 版本)
  34. 2026-08-20显存计算器:正向模式改用模型自身实测 bpw,而非通用档位表(反向模式一直如此)。GPT-OSS 20B 的 Q8_0 此前被高估 67%(21.1GB → 12.7GB)。EXL2 3.5bpw 档位恢复可选
  35. 2026-08-18中文站审计:/zh 页面的 HTML 现在自身声明 zh-Hans;/zh/cookbook 上 23 个指南链接不再把读者弹回英文站;102 个中文页面的结构化数据改为描述中文页本身
  36. 2026-08-18中文站现已可被索引:/zh/** 镜像全部 113 个页面并配对 hreflang,中文文本直接写入静态 HTML,而非加载后再替换
  37. 2026-08-08模型索引 +4 → 79:Qwen3-VL 8B / 30B-A3B、Magistral Small 1.2、Seed-OSS 36B —— 面向受限硬件挑选(12GB 卡上的多模态、适合统一内存的小激活 MoE、双卡尺寸的 512K 上下文)。Qwen2-VL 7B 标记为过时
  38. 2026-08-08新增 Cookbook:本地运行 GPT-OSS 20B/120B 且不重新量化(共 23 篇)。显存计算器新增 MXFP4 档 —— 此前给 GPT-OSS 选 Q4_K_M 会把权重高估约 14%
  39. 2026-08-07模型索引 +4 → 75:GPT-OSS 20B/120B(原生 MXFP4)、GLM-4.5-Air 106B-A12B、Devstral Small 1.1 —— 面向 16GB 显卡与统一内存 Mac 的 MoE 批次
  40. 2026-07-22打磨:重渲 og.png(71+ 模型文案),全部 22 篇 Cookbook 已加验证技术栈条
  41. 2026-07-22保鲜组合:+4 模型(Gemma 3 27B、R1-Llama-8B、Phi-4、Qwen3 1.7B)、过时标注、实测/估算、Hub「最近新增」、本周更新、RSS、Cookbook 验证栈(共 71 个)
  42. 2026-06-26面向真实访问:任务入口、移动端 GPU 档案、OG/图标、格式热度诚实标注、反馈邮箱
  43. 2026-06-26模型库 +4:Qwen3 4B、Qwen3-Coder 30B-A3B、Mistral Large 3、GLM-4-9B(共 67 个)
  44. 2026-06-26QA 修复:HF 统计合并、≤3B 筛选、CLI/VRAM 工具 bug、i18n 优化
  45. 2026-06-26模型库 +5:Qwen3 32B、30B-A3B MoE、235B-A22B、DeepSeek-V3、DeepSeek-R1(共 63 个)
  46. 2026-06-26模型库 +7:Qwen3 8B/14B、Gemma 3 4B/12B、Llama 4 Scout/Maverick、Llama 3.1 405B(共 58 个)
  47. 2026-06-25Cookbook 目录滚动高亮、代码块一键复制、Quant Hub Markdown 导出
  48. 2026-06-25Cookbook 阅读进度条、模型 HF 链接复制、Quant Hub 可分享筛选 URL
  49. 2026-06-25面包屑导航 + JSON-LD、Cookbook 文章目录锚点、Quant Hub GPU 一键筛选芯片
  50. 2026-06-25Cookbook 相关指南推荐、模型详情页相似模型卡片、首页 Hero 最新更新徽章
  51. 2026-06-25首页探索区块、404 页面、多模型基准测试(Qwen 7B/32B、DeepSeek-R1 14B)、AI 爬虫 llms.txt
  52. 2026-06-24新增关于页面(/about)— 维护者介绍、更新频率、参与贡献方式
  53. 2026-06-24Quant Hub:默认显示全部 51 个模型;规模统计条;GPU 筛选提示更清晰
  54. 2026-06-24SEO:canonical URL、JSON-LD 结构化数据、页面级 metadata、Google/Bing 验证环境变量
  55. 2026-06-24Quant Hub:GPU 档案筛选时可一键显示全部模型;Cookbook 新增 7 篇(8GB 显卡、WSL2、Docker GPU、Nginx、AMD ROCm)
  56. 2026-06-24隐私政策 + Plausible 分析、Cookbook 独立文章页(/cookbook/[slug])、模型库扩展至 51 个
  57. 2026-06-24新增使用条款与免责声明页面(/legal),含商标声明和责任限制
  58. 2026-06-24Phase 3:HF 实时数据管道、模型 A vs B 对比工具、Cookbook 扩展至 15 篇
  59. 2026-06-24模型库扩展至 30+;新增格式向导、硬件档案、ExLlamaV2 CLI、SEO(sitemap/OG)、数据透明度改进
  60. 2026-06-24模型详情页、GPU 反向查询、可分享显存计算器 URL、真实首页统计
  61. 2025-06-10首次上线:模型库、显存计算器、CLI 生成器、基准测试、部署指南

所有数据均经人工整理并对照社区来源验证。部署前请务必交叉核对 Hugging Face 官方模型卡。

Hugging Face 模型卡、社区量化发布(bartowski、turboderp、unsloth、city96)、WikiText-2 PPL 基准

浏览最近模型