做品牌 AI 曝光监测的人,多半遇到过这种情况:今天测「某某行业哪家好」,自家品牌排第二;隔几天用同一个问题再测一次,品牌没了。先别急着怀疑平台,也不一定是优化白做了 —— 很可能是你的测量方法本身,撑不住你想下的那个结论。

AI 的回答是实时组装出来的,不是从固定数据库里查出来的。检索源在变、排序在变、连同一批问题的路由都可能变,同一个问题在不同时刻拿到的引用列表,本来就会有波动。这不是 bug,是这个测量对象的本性。问题在于,很多人拿「跑一次」的结果就直接下结论。

单次运行,撑不起结论

SE Ranking 今年做过一组实验:对 1 万条 Google AI Mode 查询反复运行,发现两次运行之间,引用 URL 层面的平均重合度只有 9.2%,还有 21.2% 的查询两次结果完全零重叠。

也就是说,如果你只跑一次,五分之一的问题你看到的引用名单基本是「抽签抽出来的」。拿这种数据汇报「我们品牌引用涨了」,跟抛硬币看正反面没有本质区别。

所以第一条纪律是:核心问题必须重复运行。每次检测至少跑 3 到 5 轮,看的是「出现比例」,不是「单次结果」。品牌在 5 轮里出现 4 次,和 5 轮里只出现 1 次,才是有意义的差异。

提及和引用,是两个稳定性不同的信号

同一批研究里还有个很反直觉的反差:跨引擎比较时,品牌名层面的重合度能做到 67.4%,而 URL 层面的重合度只有 10.2%。

说白了,AI 回答里「提不提你」相对稳定,「从哪篇文章引你」非常不稳定。落到监测面板上就是:

  • 提及率当主指标:波动小、可追踪,适合放周报月报里看趋势
  • 具体引用 URL当线索用:看 AI 喜欢从哪类页面取材,指导你去补内容,而不是当 KPI 盯着它涨跌

把 URL 的波动当成绩效波动来汇报,是目前 GEO 报告里最常见的自欺。

想让面板可信,规矩就这几条

  • 措辞冻结:面板里的问题一字不改。改了措辞就等于换了样本,前后数据没法比
  • 拉长观察窗口:单次结果只回答「有没有」,周度看方向,月度才谈幅度
  • 样本别太小:拿 10 个问题测一轮就想下结论,任何数字都不可信。核心指标应该标注最小样本量 —— 中广协 9 月发布的 GEO 测量标准已经把这条要求写进去了,行业在往这个方向收口
  • 别用一次结果做归因:「昨天发了稿今天引用掉了」这种结论,在测量噪声面前基本站不住

最后

AI 可见度测量天生带噪声,这不丢人;丢人的是假装噪声不存在。先承认单次结果只是抽样,再用重复运行和足够大的样本把噪声压下去,测出来的趋势才配得上去跟老板汇报。