AI 助手如何决定引用谁
在 ChatGPT 或 Perplexity 里问一个采购问题——比如「小型法务团队用什么合同审查软件好」——答案后面会跟着脚注。整个互联网上,只有那么几个页面被选中当作依据。这几个页面的主人,从此进入了客户的决策对话;其余所有人都不在场。
这几个页面是怎么被选中的?机制其实有据可查,而且和多数人的直觉不一样,值得讲清楚。
是两套系统,不是一套
带引用的回答背后跑着两套独立的系统。语言模型负责表达和归纳;引用则来自检索层——助手把你的问题拆成若干次搜索,从一个网页索引里捞出候选页面,再基于捞到的内容组织回答。模型负责写,检索层决定哪些来源有资格存在。
检索背后的索引,和传统搜索一样,是靠爬虫建起来的。OpenAI 的文档里有一个专门的爬虫 OAI-SearchBot,用于让网站出现在 ChatGPT 的搜索结果中——它和负责训练数据的 GPTBot 是明确分开的两个爬虫。Perplexity 也划了同一条线:PerplexityBot 只为搜索索引服务,其官方文档明确说它不用于为基础模型抓取训练内容。
所以第一道门槛非常传统:爬虫能不能访问你的页面,页面在不在索引里。一个只靠 JavaScript 渲染、拦错了 user agent、或者把实质内容藏在交互后面的网站,在任何「AI 因素」起作用之前就已经出局了。
谁能通过筛选
检索给出候选,筛选把候选压缩到最终被引用的三四个页面。从一切可观察的行为看,这一步偏爱「长得像好答案」的页面:结论写在显眼处、结构机器能解析、日期可见、作者或机构身份明确。是正面回答了读者问题的页面,而不是绕着话题打转的页面。
这里没有任何新奇的东西。这些正是搜索引擎奖励了很多年的特质——所以技术底子和内容底子扎实的网站,往往没为「AI」专门做过什么,却在助手的引用里出现得格外频繁。
直觉在哪里失灵
最常见的心智模型是:「AI 在训练时学过我们,所以它会提到我们。」这个模型在两个方向上都会失灵。
模型可以从训练数据里对一个品牌了如指掌,回答时却引用竞争对手——因为引用跟着检索走,而检索捞出来的是对手的页面。训练时学过你,不会把你的 URL 放进脚注;只有索引能。
反方向的错误更隐蔽。有些团队在 2023、2024 年屏蔽了 GPTBot,想把内容挡在训练数据之外,以为事情到此为止,从此再没碰过这个文件。屏蔽 GPTBot 对 ChatGPT 的搜索可见度毫无影响——OpenAI 的爬虫文档写得很明确,GPTBot 不用于搜索。真正把你从引用系统里移除的,是屏蔽了 OAI-SearchBot,或者 CDN 替你屏蔽了它。robots.txt 里的两行规则,商业后果截然相反,却经常被当成一回事。
还有第三类爬虫,多数网站的 robots 策略从没考虑过:ChatGPT-User、Perplexity-User 这类由用户触发的实时抓取器——有人在对话里问到了你,它就当场访问你的页面。两家公司都在文档里说明,这类访问由用户发起,可能不遵守 robots.txt。这一层的控制力,比大多数访问策略假设的要弱得多。
被引用,不是对「有名」的奖励,而是对「可被检索到」的奖励。
落到实操
当一个品牌在 AI 助手的回答里缺席,原因必然出在三层之一:访问层(爬虫够不到你)、索引层(你不在检索语料里)、筛选层(检索得到你,但你从来不是最佳答案)。三层留下的证据不同,修法也不同。在动手优化任何东西之前,先诊断清楚坏在哪一层——这件事本身就是大部分工作量。