完整公开,故意的。一个数字如果你没法核它是怎么来的,那它就不是测量,是主张。 每一份报告都会印上它跑的时候用的是这份文档的哪个版本。
这份报告面向的是一家在中国、把东西卖到海外的公司。你的买家在海外, 他们用英文问 AI,所以我们也用英文问、在你填的那个海外市场问。 网站和报告是中文的,测量不是。
我们不查中文 AI 助手——百度、豆包、Kimi、DeepSeek 一个都不查——也不用中文提问。这不在这份方法的范围里,不是排期上还没做到的事。 下面这张表就是我们查的全部。
3 个面,选它们是因为它们是你的客户真的在用的东西。 其中 3 个是我们直接去问的助手, 0 个是从谷歌的实时结果里读出来的。
| 系统 | 为什么在里面 |
|---|---|
| Gemini(联网搜索) | 安卓上、以及谷歌全家桶里的默认助手 |
| Claude(凭记忆) | 企业采购方用得很多 |
| Gemini(凭记忆) | 对照组——它和联网 Gemini 之间的那个差,才是结论 |
我们宁愿列出来,也不愿让你自己假设。下面这些是已经做好并公开、但还没在跑的, 所以它们不计入本页任何一个总数,也没有任何一份报告声称测了它们:
| 系统 | 状态 |
|---|---|
| ChatGPT(联网搜索) | Vertex 上没有,所以要再接一家供应商。走的是真实界面的抓取,不是 OpenAI API,所以每条答案都带一个你自己能点开的链接。 |
| Google AI Overviews(搜索结果页上) | |
| Google AI Mode(搜索结果页上) |
在它跑起来之前,请把报告里的每一条结论都当成是关于第一张表里那些面的陈述。 那些面偏向谷歌的模型,而在那里成立的答案不会自动迁移到一个我们没测过的助手上。
每一个问题我们还会再问一遍,这一遍不给联网。两者之间的差就是有用的部分: 如果一个模型只有能搜的时候才提你,那是互联网知道你,模型不知道你。 如果两种情况下它都提你,你就在这个模型的基础知识里——那是一个强得多的位置, 也是一个慢得多才挣得到的位置。
从你的网站生成,然后在我们跑任何东西之前先给你看,让你改。
谷歌描述过它的 AI 功能会在一次搜索背后发出多个相关子查询,它管这叫 query fan-out。 所以一个问题不等于一次测试。问 23 个、铺满整条意图阶梯, 是我们覆盖这个分布而不是只采一个点的办法。
目前是 API。我们在跑的 3 个面, 全部走官方模型 API。像客户那样去读谷歌的结果页,我们做好了、也照实公开了 ——就在上面那张表里——但它要接一家付费的搜索数据供应商,我们还没开通, 所以现在没有任何一份报告包含这部分。也就是说下面这场争论适用于我们发出去的 每一个数字,所以我们宁愿把它摆在这里,而不是塞进脚注。
有些厂商把抓界面这件事包装成绝对更好,有一点他们是对的: 聊天界面里有个性化、有会话历史、有 A/B 实验,这些 API 调用看不到。 如果你想知道的是「某个已登录的人在星期二看到了什么」, API 回答不了,我们也不会假装能。
这件事有一个数字,而且是由最有商业动机去公布它的那家厂商公布的。 Surfer 把 1,000 条 prompt 同时跑过 ChatGPT 的真实界面和 OpenAI API, 发现两边点到名的品牌只有 24% 重合,被引用的来源只有 4% 重合。 在 Perplexity 上他们给出的来源重合度是 8%。照字面看,这说的是 API 的答案和屏幕上的答案接近是两个不同的总体,而我们不会因为一个数字是冲我们来的就把它埋掉。 (Surfer,2026 年 2 月 3 日。)
有两件事希望你在给它加权之前知道。它测的是 ChatGPT 对 OpenAI API; 我们的模型面是 Gemini 和 Claude,对应的研究没有人发过, 所以那 24% 对我们是提示性的,不是在我们身上测出来的。 另外 Surfer 没有公布他们怎么判定两个品牌名或两个 URL 是同一个东西, 而那件事是任何重合度数字里最主要的工作量。我们没有复现过。
我们是故意走 API 的,为的是它更擅长的那件事:可复现。 同样的 prompt、同样的参数、没有别人会话里带来的检索噪音—— 这是三个月后再跑一次还有意义的唯一办法,而复测正是我们真正在卖的东西。 抓界面拿到的结果原理上就复现不了,这也是没有一家这么做的厂商公布置信区间的原因。
所以请把我们模型面上的数字读成受控条件下这个模型的倾向, 而不是某个真实用户屏幕的实录。我们从来没有声称过第二件事,这一页就是我们把它说出来的地方。 报告里没有哪一节能给你「用户看到了什么」那个口径,因为承载它的那两个面 现在没在跑。等它们跑起来,这一段会告诉你去看哪里。
这场争论碰不到的部分:阻断类发现。你的页面有没有被标 noindex 或
nosnippet、你的 robots.txt 有没有禁掉某个 AI 爬虫、
你的地址和电话在全网一不一致——这些都不会因为模型是怎么被查询的而改变,
而这些恰恰是最经常成为「一家公司为什么隐形」真正原因的东西。
当你的报告以被挡住了开头时,抓取还是 API 这场争论影响不到它。
我们加 ChatGPT 的时候,走的会是真实界面的抓取而不是 OpenAI API,
理由就在这一页上。
你的报告开头是四个答案里的一个,回答的是你买它想解决的那个问题: 这件事现在值不值得花你的钱?答案是从数字里机械地选出来的,不是手写的, 所以同一次运行永远得到同一个结论,而且你可以核这个推导。
| 结论 | 什么时候这么说 |
|---|---|
| 这事别管了 | 在提问的人在挑用谁、或者准备预约或下单的那些问题上(L3 和 L4 两层), 你被点名的比例达到 33.0% 或更高。 这一条最先检查,因为这份报告能告诉你的最有价值的事,就是把钱留着。 |
| 有东西在挡着你 | 我们发现了 6 项特定设置中的一项,它们会让一个页面 直接失去进入 AI 答案的资格——一条 noindex 或 nosnippet 指令、robots.txt 里被禁掉的 AI 爬虫,或者一个只有 JavaScript 跑完才存在的页面。一个已知的机械原因优先于 同一次运行的任何统计读数,因为你自己就能验证它,而且改一次就完了。 |
| 基本隐形,但原因看起来很便宜 | 你没有被点名,而且有证据表明这些引擎已经够得到你的材料—— 它们读了你的站然后推荐了别人,或者你偶尔会冒出来。 这个位置比它感觉上要好。 |
| 隐形,而且我们认为花钱解决不了 | 没有机械原因,没有迹象表明引擎够得到你,同行从头到尾被点名。 我们会直说。这是四个里最不舒服的一个,也是最可能替你省下一年顾问费的那个。 |
每个结论都带一个置信度,并附上理由。这条下限我们借自 Trakkr——这个领域里 我们能找到的唯一一条公开的统计规则:低于 20 次提及, 一个比例只是方向,不是测量。低于这条线你的报告会写明,而不是四舍五入成它没挣到的确定性。 如果这套方法里有任何一部分在你的站上没跑成,置信度会自动降一档,不管数字多好看。
字符串匹配不够,而这正是大多数免费工具出错的地方。 问「tell me about Acme Dental」,答案里当然会有「Acme Dental」, 不管模型知不知道任何事。那是回声,不是认识。
每一条回答都会由一次独立的模型判读归入以下之一:
| 结果 | 含义 |
|---|---|
| 推荐了你 | 被点名为一个值得考虑的选项 |
| 顺带提到你 | 被点名了,但不是作为推荐 |
| 读了你的网站,推荐了别人 | 你的网站被当成来源用了,而被推荐的是同行。这一条很扎心,而且很常见。 |
| 只是把我们给它的名字重复了一遍 | 你的名字出现,只是因为它本来就在问题里 |
| 没有提到你 | 压根没提 |
每一条旁边还有:你被点名时在名单里的位次,以及你相对于所有出现过的其他公司的声量占比。
AI 的答案会漂。第三方追踪把谷歌 AI Overview 内容的周变化率放在接近 70%, 而引用来源集合每次模型更新都会变。你自己挑对你最重要的 3 个问题; 我们每个问 3 次,并报告答案有多一致。 一条 3 次都成立的发现,和一条只出现过一次的发现, 在你的报告里标注是不一样的。
我们不把全部 23 个问题都重复——那会让报告成本大约翻三倍, 而且不会改变你会做的任何一个决定。我们也不跨天采样,因为那要让你等一个星期。 这两条限制都写在你的报告里。
谷歌把本地排名描述为相关性、距离和知名度。第一项和第三项我们直接测。 距离这一项,我们从你地址周围的若干坐标点分别跑你的关键查询, 记录你在每个点的地图包里排在哪——这给你的是你覆盖范围的实际边界, 不是一个理论半径。
我们还会检查你谷歌商家资料的主品类(那是那里杠杆最大的一个字段)、 你的评价数量、评分、新鲜度和回复率,以及你的名称、地址、电话 在你自己的站和 AI 会读的那些目录站之间是否一致。
一个页面要出现在谷歌的 AI 功能里, “no additional requirements … nor other special optimizations necessary” (没有额外要求,也不需要什么特别的优化)。
—— Google Search Central,AI features 文档
我们故意引这句,尽管它拆的是整个 GEO 行业的前提。 谷歌的立场是:一个页面需要被收录、并且有资格展示摘要,你不需要去造新的机器可读文件或特殊标记。 我们认为这大体是对的。
而这恰恰说明有价值的东西不是优化建议——是弄清楚 AI 现在到底怎么说你。 这件事不真的把查询跑一遍谁都告诉不了你,而认真跑一遍要花钱, 要 150 次 API 调用。那就是这个产品。
写在这里而不是埋起来,而且每一份报告的附录里都会再写一遍:
这套方法是冻结的。问题数量、分类规则和每一个指标的定义都固定在 v1.0。 我们要是改了其中任何一个,版本号就会变,而按旧版本跑出来的报告仍然写着旧版本—— 所以两份带同一个版本戳的报告永远可比。
判断一套方法最好的办法,是读一份它产出的报告。
读一份完整的样本报告我们想用 Google Analytics 统计有多少人看了这个页面、又有多少人真的买了报告—— 除此之外不做别的。它会往你的浏览器写 cookie,并把你的 IP 发给谷歌, 所以得先问你一句。说不也完全不影响你用这个网站。 具体收了什么。