CANONLY
全部研究笔记

悄悄决定你 AI 可见度的,是几条爬虫规则

过去二十年,robots.txt 是个走形式的文件——上线时写三行,之后再没人打开过。现在,它成了决定一家公司 AI 可见度的文件。做决定的,有时是一个早已离职的人,有时是一条没人读过的供应商默认配置。

今天访问你页面的爬虫分三类,三类的商业含义完全不同,却经常被混为一谈。

三类爬虫

  • 训练爬虫——GPTBot(OpenAI)、Google-Extended、CCBot(Common Crawl)。它们为模型训练收集内容。屏蔽它们是一种知识产权立场;按各家自己的文档,这不会把你从搜索结果或引用里移除。
  • 搜索爬虫——OAI-SearchBot(ChatGPT 搜索)、PerplexityBot,以及 Googlebot 本身。AI 助手引用时依赖的索引,就是它们建的。OpenAI 把后果写得很直白:屏蔽 OAI-SearchBot 的网站,不会出现在 ChatGPT 的搜索回答中。
  • 用户触发的抓取器——ChatGPT-User、Perplexity-User。有人在对话里问到你,它们就实时访问你的页面。两家都在文档里说明:这类访问由用户发起,可能不遵守 robots.txt。这一层的规则基本没有强制力。

分类清楚了,决策框架自然就出来了:屏蔽训练爬虫,今天几乎不损失任何可见度,是一个站得住的权利主张;屏蔽搜索爬虫,是一个直接连着收入的可见度决定;给抓取器写规则,大体上是做样子。

你从没做过的那个「屏蔽决定」

更麻烦的问题是:很多网站正在屏蔽搜索爬虫,但从来没人做过这个决定。2025 年 7 月 1 日起,Cloudflare 把新接入域名的默认策略改成了拦截 AI 爬虫,并把这定位成对内容补偿问题的表态。对出版商来说这是个合理立场——但对之后每一个把网站放上 Cloudflare、又从没打开过爬虫管理设置的团队,这是一道无声的可见度断崖。

这种故障从内部看是隐形的:内容没问题,robots.txt 看起来也开放,可 CDN 对那几个真正产生引用的爬虫返回的是 403。内容团队照常发布,看着自己在 AI 助手里毫无踪影,最后得出结论——「AI 搜索对我们这个行业不重要」。其他厂商的托管 WAF 和爬虫防护产品,默认值不同,效果相同。

你真正生效的 robots 政策,是基础设施实际返回的东西,不是文件里写的东西。

十分钟自查

  • 在你自己的网络之外,用每个爬虫的真实 user-agent 请求你的关键页面,把状态码记下来。
  • 去读 CDN 和 WAF 配置里关于 AI 和爬虫的部分——只看 robots.txt 不够。
  • 对三类爬虫分别做出明确决定:训练、搜索、抓取器。把决定写下来,注明日期。
  • 每次迁移 CDN 或更换安全产品后重测一遍。默认值会变,你的策略可能已经跟着变了。

写这篇笔记之前,我们在本站跑了第一步的自查——上面提到的每个爬虫都返回了 200。整个过程大约四分钟。这一层的投入产出比,大致就是这个数量级。