ChatGPT在搜索之前就已经知道要推荐谁了

原文:https://suganthan.com/blog/chatgpt-decides-before-it-searches/

挪威的 SEO 从业者 Suganthan Mohanadasan 做了一件很实在的事:不看 ChatGPT 输出了什么,而是去读 ChatGPT 联网时的网络请求。两个月下来,他得到一个结论——推荐名单在检索发生之前就已经存在。

这个发现最有价值的地方是可复现。你打开浏览器,两分钟就能自己验证一遍,不需要相信任何人的转述。

模型自己写检索词,而且这些检索词可以读

ChatGPT 联网时不是把你的问题原样丢给搜索引擎,它会先改写成自己的检索词,再去抓页面。这些检索词就在你浏览器收到的响应 JSON 里,字段名当前叫 search_queries(8 月初刚从 search_model_queries 改名)。打开 DevTools 的 Network 面板就能看到。

问它”best AI note taking app”,七个单词,一个品牌都没提。它写出来的第一条检索词是这样的:

best AI note taking apps 2026 official pricing features Granola Notion AI Otter Fireflies Fathom Mem Limitless

尾部七个产品名。用户没提,而此时还没有任何页面被抓取,所以也不可能是检索结果带回来的。随后它跑了九条 site:granola.ai pricing… 这样的检索,一个名字一条,全部指向该公司自己的官网。

也就是说,fan-out 不是在寻找候选,而是照着一份已有的名单逐个核实。

Suganthan 做了时序验证来排除干扰:只取每场对话的第一条用户消息和第一条检索词,此时没有任何东西被抓取过。27 场对话里,21 场的首条检索词含有用户从未输入的品牌。再换 13 个互不相关的品类重跑,11 个出现同样情况——语言学习是 Duolingo、Babbel、Busuu,会计软件是 Xero、QuickBooks、Zoho Books,扫地机器人直接写出了 Saros、Dreame X50、Eufy S1 Pro 这样的具体型号。

触发条件也测过。跟”best”这个词无关,只跟模型是否需要自己提供产品有关:你点名品牌,它顺着你的名字走;你不点名,它从记忆里取。有一条测试值得单独看——输入”我们的会议记录一团糟,没人整理”,这是一句抱怨不是购买咨询,它照样在抓取任何页面之前写出了 Granola official pricing AI meeting notes 2026。

在名单里和不在名单里,差 33 倍

Suganthan 把所有品牌分成两组:出现在 ChatGPT 自己写的检索词里的,和只是在检索过程中被抓取、但从未被点名的。

  • 被写进检索词的:119 个,最终进入答案的比例 68.9%
  • 只被抓取、从未被点名的:515 个,进入答案的比例 2.1%

另外还有 86 次,品牌被推荐了,但整场对话里它的网站根本没有被抓取过。

被推荐不需要被抓取。这一条对精力该往哪放,有直接影响。

名单从哪里来

名单来自模型参数,参数来自训练语料,训练语料里关于你的部分,是别人写的。

评测、榜单、对比文、行业媒体、社区讨论,共同决定了模型提到这个品类时会不会想起你。它有三个属性:不由你控制,写的人不是你;不即时,要等下一轮训练;不可加速,花钱能买到一部分曝光,买不到长期的书写密度。

站内工作在这一层使不上力,原因很简单——名单形成的时刻,你的服务器还没有被联系。schema、加载速度都在那条线的后面,llms.txt 更明显:那个文件要被读取,前提是有人先访问你的域名。

顺带说一个容易被忽略的数量级。互联网上有能力写下一次提及、给出一条链接的人,比想象中少得多。一家十万人级别的公司,能在官网上加一条外链的可能不超过一百人。发布权是高度集中的,链接图和提及图都由这一小撮人写成。这解释了为什么”内容好自然会有人写你”在多数领域不成立——有能力写你的人,往往不在你的读者里。

点完名之后,它去官网核实

回头看前面那几条检索词,有一个细节容易被跳过:几乎每一条都带着 official 这个词。

…official pricing features Granola Notion AI Otter…Intercom Fin Zendesk AI pricing officialsite:hostinger.com/uk wordpress hosting pricing UK official

这是个稳定的模式,Lily Ray 也观察到过同样的现象:模型在处理产品和服务类问题时,会主动往检索词里加 official 这类限定词。放到上面那个流程里看,它的位置很清楚——点完名之后,下一步是回到这个品牌自己的域名上核实,而且核实对象很具体:价格、功能、规格。

所以站内页面在整个流程里不是没有位置,位置反而很明确:**它是核实环节被指定的落点。**第一层决定要不要来找你,来了之后找的就是官方事实页。

对应到动作上:价格、参数、功能、适用范围这些事实要以 HTML 纯文本写在自己域名的对应页面上,不要只放在图片、PDF 或者需要 JS 渲染的组件里。对 B2B 站点,承载这件事的是产品页和分类页,不是博客。

这一点也顺带解释了一个常见的错觉——为什么”把站做干净、让机器好读”听起来对 AI 有用。在核实这一步,它确实有用。只是这一步发生在被点名之后,它不改变要不要被点名。

进了名单之后,还有第二道筛选

这一层的数字同样不宽松:57 场对话、3554 个被抓取的页面,最终拿到引用的是 110 个,3.1%。ChatGPT 大约读 600 个页面写出一个答案,其中给出引用的约 30 个。

但这一层和上一层性质不同,它有可操作的杠杆。

同域名分组内的位次几乎决定一切:

组内位次 被引用率
第 1 5.2%
第 2 4.6%
第 3 2.4%
第 4 1.7%
第 5 0.6%
第 6 及以后 0.3%

第三名往后基本是舍入误差。被抓到不等于赢,排在第九和没进去差别不大。

同一域名塞多个页面进同一组会互相稀释:1 个页面 4.0%,2 个页面 6.2%(最佳),5 个跌到 1.9%,6 个以上 1.7%。过了这条线,主要是在跟自己竞争。

还有一条:相关性只负责入围,不负责胜出。被引用的页面在相关性上处于候选池前 5%,但只有 20% 的情况下它是最匹配的那一个。写得对能让你进候选,选中你的是别的东西——这部分 Suganthan 说他看不到。

这是两层,动作不一样

第一层是进不进得了品类词汇表。路径只有一种:被写、被评测、被对比、被收进榜单,持续积累到这个关联进入训练数据。慢,不好看,但站内工程在这一层没有着力点。

第二层是进去之后拿不拿得到引用。一个意图一个页面,别让近似页互相稀释,回答问题的那句话放在页面靠前的位置,数字用 HTML 纯文本写出来而不是塞在图片或 JS 里。

这两层经常被合成一件事来处理,而多数动作落在第二层。分清楚之后,预算怎么切就清楚了:不在检索词里,钱该花在让别人写你上;已经在检索词里,页面工程才轮得到。

对 2B 站点的现实判断

第一层,多数 B2B 细分品类进不去,也不必强求。这类品类通常没有被媒体和评测反复书写的传统,模型手里没有稳定名单,写出来的往往是大平台或行业媒体。

能做的是第二层,加上一条旁路:去做那个被引用的第三方来源本身。

这件事我在客户站上遇到过。一篇制造商榜单类的文章,在品类词的 AI 概览里被反复引用,来源面板上和几个国际品牌并列——但 AI 正文推荐的全是别家,客户品牌虽然写在自己那份榜单里,也不会被正文推荐,只以引用来源的身份存在,用户点进来源才会看到这个品牌。

分界就在这里:自己说自己,换到的是引用位;要被推荐,得靠第三方跨来源提及。引用位的转化不如推荐位,但对这类客户,它是第一层之外够得着的位置

来源公众号: 中文SEO启蒙第一人(ID:ylsseo)玩LOL,做SEO,SEM

本文由 @鸭老师SEO 原创发布于奇赞平台,未经许可,禁止转载、采集。

该文观点仅代表作者本人,奇赞平台仅提供信息存储空间服务。

赞 (0)

为你推荐

发表回复

登录后才能评论
李坤锦
李坤锦
公众号
公众号
视频号
视频号
小程序
小程序
返回顶部