自建审计称94.8%网站未进入AI购买回答
两个子样本分别衡量答案点名与机器可读性,不能外推全网,更不能据此证明因果。
本文要点
- 答案面板由175个站点扩至193个,统计窗口延长至8月2日。
- 机器可读性样本由418个站点扩至436个。
- 发布方披露@graph漏检已修复,因此结构化数据指标下版不可直接同比。
阅读辅助
先看数字、证据和来源,再读正文。
94.8%只表示自选样本中未被四款助手点名的站点占比。
2026-03-30 · 指数总语料的审计起始日;截至8月2日累计531次审计。
94.8%是一个很醒目的数字,但它回答的是一道窄题:在发布方自行形成的站点样本里,有多少企业没有被四款助手的购买意图回答点名。它不是“全网网站进入AI答案的失败率”,也不是网站做好技术优化后仍会失败的概率。
这份8月2日更新能够确认的是:answer presence子样本覆盖193个站点,统计期为2026年7月23日至8月2日,共得到5,978条回答;只有10个站点至少被ChatGPT、Claude、Gemini或Perplexity中的一款点名,因此未被点名的是183个站点,占94.8%。
局限不应放到脚注里。样本由主动运行Website Auditor免费审计的站长形成,并非随机抽取;企业名称依靠模糊匹配识别,模型回答又具有非确定性。机器可读性使用的还是另一组436个站点,不能拿它与answer presence直接做因果推断。
对网站运营者,这组数据要求把两项工作分开:一项检查爬虫能否读取站点,另一项持续测试企业是否真的进入具体问题的答案。前者是技术输入,后者是观察结果;允许访问、发布结构化数据都不等于自动获得推荐。
先拆开三个容易混淆的分母
指数页顶部写着531次已存审计、458个不同域名、38个检测行业。这是从3月30日至8月2日积累的总语料,用来说明数据库覆盖规模。它并不是headline里94.8%的分母。
发布方实际把数据切成两个分析面板。answer presence只使用7月23日以后能够按四家独立提供商比较的记录;machine readability则使用更长窗口,并由发布方自己的爬虫检查首页、robots.txt与sitemap.xml。三个数字层次如下:
| 数据层 | 时间窗口 | 样本与观测 | 本版可回答的问题 | 不能回答的问题 |
|---|---|---|---|---|
| 总审计语料 | 3月30日至8月2日 | 531次审计、458域名、38行业 | 数据库累计了多少审计记录 | 不能作为94.8%的分母 |
| Answer presence | 7月23日至8月2日 | 193站点、5,978条回答 | 受测企业是否至少被四款助手之一点名 | 不能代表全网,也不能说明未点名原因 |
| Machine readability | 5月16日至8月2日 | 436个站点 | 首页、robots.txt与sitemap中的技术信号 | 不能证明某信号会带来点名 |
方法页称每个面板都只保留每个域名最近一次审计,避免同一站点反复扫描后获得多票。这是合理的去重办法,却没有消除选择偏差:进入样本的前提仍是某位站点所有者主动使用该工具。此类用户更可能是中小企业,也更关心自身网络呈现,因此样本描述的是“主动做网站审计的企业”,不是互联网总体。
8月2日新增的是扩样,不是统计结论翻转
这次的news peg来自第二版更新。7月31日第一版的answer presence面板有175个站点,机器可读性面板有418个站点;8月2日两者分别扩至193个和436个。发布方称主要headline比例的变化都小于1个百分点,Gemini仍在该面板中覆盖最广。
分助手看,Gemini在其回答中点名受测企业的比例为2.9%,涉及8个站点;ChatGPT为1.7%,涉及5个站点;Claude与Perplexity均为1.6%,分别涉及5个和8个站点。这里的“回答占比”与“被点名站点数”是两种指标,站点还可能在不同助手之间重合,不能把四行相加成总覆盖率。
ChatGPT还有一个单独的分母问题:面板原计划产生1,544次查询,实际返回1,352条回答,其余192次在提供商处失败。指数把失败查询从分母排除,企业未被提及的统计不含这些服务故障;四款助手的回答数因此并不完全相等。
第二版仍然是描述性快照。扩样后比例变化较小,可以说明这批自选样本在两天内没有剧烈改写;它不能证明比例已经稳定,更不能证明换地区、换行业、换问题模板后仍会得到同样结果。
94.8%与1.9%衡量的是不同单位
页面同时给出另一个数字:在全部5,978条助手回答中,只有1.9%点名了问题所对应的受测企业。94.8%按站点计数,问题是“一个站点是否至少成功过一次”;1.9%按回答计数,问题是“单条回答是否点名目标企业”。一个企业只要在大量回答中出现一次,就会进入前一指标的“出现过”一侧,但其绝大多数回答仍可能没有点名。
点名判断也不是人工逐条裁决。发布方使用模糊名称匹配,把回答中的企业与受测业务对应起来。方法页承认,约五分之一企业只能通过域名识别,这类对象最难匹配,因此结果可能偏向漏计。这个方向性判断仍缺少公开的精确率、召回率和人工复核样本;在这些数据公开前,“更可能低估”只能视为发布方对误差方向的解释。
模型输出的波动又叠加一层误差。同一问题在不同时间重跑,答案名单可能变化;助手索引也持续更新。所以本版只能描述截止8月2日的这组回答,不能把某个站点的一次缺席解释为长期不可见,更不应把一次出现解释为稳定渠道。
8.9%不是“网站拒绝AI”的比例
机器可读性面板显示,436个站点中39个在robots.txt里屏蔽了至少一种AI crawler,即8.9%。关键词是“至少一种”:它可以是训练爬虫,也可以是实时检索代理,不意味着这些站点把所有AI相关访问全部挡住。
分项数据进一步说明差异。GPTBot与CCBot各被38个站点屏蔽,ClaudeBot被36个站点屏蔽;OAI-SearchBot只被4个站点屏蔽,Perplexity-User只被3个站点屏蔽。OpenAI官方文档按用途列出不同机器人,Anthropic也提供站点所有者控制爬虫的说明。厂商命名与用途应分别核对,不能用“AI爬虫”一个总称替代。
RFC 9309对robots.txt的边界更明确:它是一套要求自动客户端遵守的URI访问规则,不是访问授权机制。因此,检测到Disallow只能说明站点表达了抓取偏好;它不能证明所有客户端都遵守,也不能证明被允许的页面一定进入模型索引、实时检索或最终答案。
指数原文把训练爬虫与实时检索代理的后果写得很确定,称屏蔽后者会让站点不可引用。更稳妥的表述应是:屏蔽特定检索代理会阻止该代理按其公开身份抓取相应路径,从而减少通过这条抓取路径被引用的可能;助手仍可能使用既有索引、其他来源或不同检索链路。本版没有设计实验去测量单个robots.txt规则改变前后的引用增量。
结构化数据指标本版存在已知漏检
指数报告54.6%的机器可读性站点在首页发布了某种schema.org结构化数据,即238/436;LocalBusiness类型为19.3%,即84/436。这两个数字看起来适合做网站基线,但本版检测器存在明确缺陷。
发布方披露,截至8月2日,检测器只读取每个JSON-LD块的顶层,没有正确进入Yoast和大量WordPress站点常用的@graph容器。一个正确把LocalBusiness放在@graph里的站点,可能被本版记作没有结构化数据。修复在8月2日完成,意味着下一版即使网站没有任何变化,检测率也可能仅因代码修正而上升。
所以,下一版结构化数据比例不能与本版直接同比。合理做法是重跑本版436个站点形成修正基线,或者明确标记方法断点;若只把修复后的新数字减去54.6%,差值会混合真实采用变化、样本变化与检测器变化。
这一缺陷也提醒读者:指数把“首页未检测到”写作站点层面的缺失,但扫描范围只有首页、robots.txt和sitemap.xml。内页存在结构化数据而首页没有,同样会被归入缺失。它衡量的是规定位置上的可见信号,不是整个网站的完整技术清单。
这份指数最有价值的贡献,是把“答案里有没有名字”和“站点是否方便机器读取”并排展示;最容易被误用的地方,也是读者会自然地把两列连成因果链。当前数据只能支持一句克制判断:在这批主动审计的中小企业站点中,答案点名很少见,而多数站点并未明确屏蔽AI爬虫。
两者同时发生,不代表开放抓取无用,也不代表加结构化数据就能进入答案。品牌知名度、第三方提及、地点与类别竞争、助手索引、问题模板和名称匹配都可能影响结果。本版没有随机分组、没有站点变更前后对照,也没有用同一组193站点完整连接技术信号与回答结果,因此不具备因果证明能力。
对运营团队,正确的行动顺序是先修复可控且可验证的技术问题,再建立独立的答案监测。robots.txt、sitemap与结构化数据应按网站自身需求配置;随后用固定问题集、固定地区和重复运行记录点名及引用变化。不要把94.8%当成行业恐慌指标,也不要把任何单一标记当成“AI排名按钮”。
对发布方,下一步比扩大样本更重要的是提高可复核性:公开匿名提示词、逐查询成功状态、名称匹配审计样本,以及修复@graph后的回溯基线。只有把选择偏差、匹配误差和模型波动分别量化,指数才可能从产品驱动的观察样本走向可比较的行业测量。
后续验证应盯住四类误差
- 抽样误差:引入按行业、地区和站点规模分层的随机样本,并与主动审计样本并列报告。
- 匹配误差:披露模糊名称匹配的人工复核结果,尤其是仅能通过域名识别的企业。
- 模型波动:对同一批问题进行多次重跑,报告站点级稳定出现率,而不只给单次汇总。
- 方法断点:用修复后的
@graph检测器回算旧样本,避免把工具修复误写成网站采用率增长。
在这些问题解决前,94.8%适合当作一组自选样本的预警快照:企业进入AI购买回答并不容易。它不适合升级为全网结论,也不能用来证明“机器可读性不重要”或“结构化数据能带来推荐”中的任何一个命题。