GEO雷达

我们怎么测

方法只在这一页讲。其他页面只给结果。

本页目录
  1. 为什么问一次不算数
  2. 为什么给区间
  3. 为什么不给总分
  4. 默认态与联网态
  5. 精度档位
  6. 什么时候不出比率
  7. 数据怎么存
  8. 我们不做什么

为什么问一次不算数

同一个问题向同一家 AI 问两次,两次回答里出现的品牌名单只有约 16% 重合(试验期实测,DeepSeek 与秘塔,未做品牌归一化的首次抽样)。 截一张图得到的「曝光率」基本不可复现,下次问就变了。

所以我们把同一组问题、每次开一个全新会话,在每家平台独立问 30 次。30 次里提到你几次,就是几个百分点。 这模拟的是 30 个陌生用户分别去问的结果,不是某一次的运气。

为什么给区间

问 30 次和问一万次的把握不一样。「提到 12 次(40%)」旁边的区间,意思是:真实水平大概率落在这个范围内。

点是 40%,横线是 24% 到 58% 的范围,刻度是 0、50、100。n=30 时区间就有这么宽。

两期对比时,只有两期的区间不重叠,我们才说它变了。区间重叠的涨跌标成「噪音范围内」,不画箭头。 少一个箭头,你就少为噪音改一次策略。

为什么不给总分

实测各家平台的头部品牌几乎不重合:DeepSeek 推的和秘塔推的是两拨。把七家平均成一个「综合可见度」,会把两边的真实信号一起抹掉。 报告按平台一张一张给,你的客户用哪个 AI,就看哪张。

默认态与联网态

默认态是大多数用户打开 App 直接问时看到的基线。联网态是开了联网搜索之后的回答,受新发布的内容影响更大。

两者的差值提示投放在这家平台会不会起效:差值大,说明内容有效,只是平台默认不去查;差值接近零,先解决收录。 平台的默认行为会变(元宝在 2026 年 7 月改成默认联网),所以每期都按当期实测来读。

精度档位

样本量 n = 问题数 × 轮次。精度按 p=50% 处的最坏情形算,样本越多区间越窄。

每家平台的样本量精度(±百分点)能分辨什么
n = 15±22.5头部与边缘。免费体检的最低档,也是不出比率的门槛
n = 30±16.8头部、中间、边缘三档。榜单默认口径:3 问 × 10 轮
n = 40±14.8简历品类的历史口径:20 问 × 2 轮
n = 100±9.6追踪 10 个百分点以内的改善

提及率低于 5% 的品牌,小样本只能给「几乎不可见」的定性结论。要追踪 1% 到 10% 的改善,n 至少要 50。报告里会写清楚,不假装能测。

什么时候不出比率

有的平台会对相同问题返回一模一样的缓存答案。重复的回答不是新观测,按名义次数算提及率会把精度夸大好几倍。

我们按有效样本(内容去重后的独立回答数)算比率和区间。有效样本少于 15 且检测到重复时,该平台这一期不出比率, 但留在页面上写明原因。它是测不准,不是 0。

数据怎么存

  • 每问一个新会话。这是隔离记忆污染的唯一手段,不为性能省掉。
  • 原始回答永久存档。每个比率都能点开看 AI 的原话;品牌词典更新后,历史指标可以整体重算。
  • 指标必带样本量与区间。页面上没有一个比率是脱离 n 的。
  • 没跑完不出结论。采样进行中的平台只显示进度。

我们不做什么

不做优化、不发稿、不承诺排名。只做第三方测量。
不给综合分、不给品牌总分。平台之间只并列,不合并。
不用单次截图当数据。每个数字都问了 30 次。
不在采集中出结论。进度就是进度。

查我的品牌