研究笔记
来自我们对搜索与 AI 发现系统的研究:简短、有出处。不做预测,不造概念——只讲机制、一手来源,以及它们对决策的意义。
ChatGPT、Perplexity、Gemini 给出的引用来源,不是模型凭记忆想出来的,而是由一套检索层挑选的——这套检索层的行为很像搜索引擎,因为它本质上就是。
Google 已经把准入机制写进了官方文档,而它基本上就是传统搜索那一套。本文讲清楚文档说了什么,以及一个连认真做功课的团队都常犯的屏蔽错误。
robots.txt 已经变成一份有商业后果的政策文件。本文梳理里面的各类爬虫该怎么对待,以及一个会替你把它们全拦掉、而你毫不知情的 CDN 默认设置。